OpenAI запустив цього четверга (5) GPT-5.4, свою найпотужнішу та ефективнішу передову модель, призначену для професійної роботи. Disponível у ChatGPT як GPT-5.4 Thinking, в API та в Codex нова система інтегрує останні досягнення в міркуванні, кодуванні та агентських робочих процесах. Версія Pro відповідає вимогам максимальної продуктивності в складних завданнях. Модель виконує професійні дії з більшою точністю та меншою потребою в налаштуваннях, що приносить користь користувачам у корпоративному середовищі та середовищі розробки.
GPT-5.4 поєднує функції кодування з GPT-5.3-Codex із покращеннями інструментів, програмного забезпечення та завдань, пов’язаних із електронними таблицями, презентаціями та документами. Ele надає результати, узгоджені із запитами з меншою кількістю повторних взаємодій. У ChatGPT GPT-5.4 Thinking відображає заздалегідь продуманий план, що дозволяє коригувати в реальному часі для більш точних відповідей. Веб-пошук набув глибини в конкретних запитах і підтримує контекст у розширених діалогах.
Продуктивність у професійних тестах
GPT-5.4 отримав 83,0% перемог або нічиїх проти професіоналів в оцінках GDPval, які охоплюють 44 професії та потребують реальних продуктів, таких як бухгалтерські таблиці та презентації. Індекс Esse перевищує 70,9% GPT-5.2. Executivos від таких компаній, як Mercor і Harvey, підкреслюють перевагу в довгострокових результатах і комплексному правовому аналізі.
Модель покращує створення та редагування електронних таблиць із середнім балом 87,3% у тестах внутрішнього фінансового моделювання порівняно з 68,4% для попередника. Apresentações, згенеровані GPT-5.4, віддавали перевагу в 68% випадків оцінювачам через витончену естетику та ефективне використання зображень.
Власні можливості використання комп’ютера
GPT-5.4 представляє власну підтримку роботи комп’ютера, дозволяючи агентам виконувати складні потоки в різноманітних програмах. Ele підтримує до 1 мільйона маркерів контексту для планування та перевірки на довгому горизонті. Модель виділяється в таких тестах, як OSWorld-Verified, з показником успішності 75,0%, і WebArena-Verified, який досягає 67,3%.
Покращене візуальне сприйняття сприяє аналізу документів і зображень високої роздільної здатності. На MMMU-Pro точність досягає 81,2% без інструментів. Введення деталей зображення підтримує до 2,56 мільйонів пікселів, покращуючи локалізацію та точність клацання.
Прогрес у кодуванні та ефективності
GPT-5.4 відповідає або перевершує GPT-5.3-Codex на SWE-Bench Pro із меншою затримкою на етапах обґрунтування. Режим /fast у Codex збільшує швидкість токенізації до 1,5 разів. Складні інтерфейси Tarefas забезпечують більш естетичні та функціональні результати.
Експериментальний навик під назвою Dramaturgo Interativo дозволяє візуально налагоджувати веб-додатки та Electron. Exemplos містить симуляції тематичних парків, створені за простими підказками, з автоматизованим тестуванням через Playwright.
Покращення у використанні інструментів і пошуку
Пошук інструментів API зменшує кількість токенів, необхідних у широких екосистемах, заощаджуючи 47% на завданнях Atlas MCP. Виклик інструменту агента підвищує точність у Toolathlon. Постійний веб-пошук покращено на BrowseComp із точністю 82,7%.
GPT-5.4 Thinking описує міркування щодо довгих запитів, що дозволяє здійснювати націлювання без перезапусків. Ele підтримує когерентність у довгих потоках і зменшує галюцинації, на 33% менше хибних тверджень і на 18% менше помилок у повних відповідях.
Наявність і ціна
Розгортання відбувається поступово на ChatGPT і Codex. В API GPT-5.4 доступний як gpt-5.4, а версія Pro як gpt-5.4-pro. Usuários Plus, Team і Pro отримують доступ до GPT-5.4 Thinking, замінюючи GPT-5.2 Thinking, який залишається протягом трьох місяців. Planos Enterprise і Edu дозволяють доступ через адміністративні налаштування.
Ціна відображає розширені можливості, але символічна ефективність окупається в багатьох завданнях. Пакет Processamento і Flex коштує половину стандарту, тоді як пріоритет подвоює ціну.

