OpenAI lance GPT-5.4 en mettant l’accent sur le travail professionnel et les agents autonomes
OpenAI a lancé ce jeudi (5) GPT-5.4, son modèle frontière le plus performant et le plus efficace destiné au travail professionnel. Disponível dans ChatGPT comme GPT-5.4 Thinking, dans l’API et dans Codex, le nouveau système intègre les avancées récentes en matière de raisonnement, de codage et de flux de travail agentiques. La version Pro répond aux exigences de performances maximales dans les tâches complexes. Le modèle exécute des activités professionnelles avec une plus grande précision et nécessite moins d’ajustements, ce qui profite aux utilisateurs des environnements d’entreprise et de développement.
GPT-5.4 combine les fonctionnalités de codage de GPT-5.3-Codex avec des améliorations des outils, logiciels et tâches impliquant des feuilles de calcul, des présentations et des documents. Ele fournit des résultats alignés sur les demandes avec moins d’interactions répétées. Dans ChatGPT, GPT-5.4 Thinking affiche un plan pré-pensé, permettant des ajustements en temps réel pour des réponses plus précises. La recherche sur le Web a gagné en profondeur dans des requêtes spécifiques et maintient le contexte dans des dialogues étendus.
Performance dans les benchmarks professionnels
GPT-5.4 a obtenu 83,0 % de victoires ou d’égalités contre des professionnels dans les évaluations GDPval, qui couvrent 44 professions et nécessitent de vrais produits comme des feuilles de calcul et des présentations comptables. L’indice Esse dépasse les 70,9 % de GPT-5.2. Executivos de sociétés comme Mercor et Harvey mettent en évidence leur supériorité en matière de livrables à long terme et d’analyses juridiques complexes.
Le modèle améliore la création et l’édition de feuilles de calcul, avec un score moyen de 87,3 % aux tests internes de modélisation financière, contre 68,4 % pour son prédécesseur. Les Apresentações générés par GPT-5.4 ont été préférés dans 68 % des cas par les évaluateurs humains en raison de leur esthétique raffinée et de leur utilisation efficace des images.
Capacités natives d’utilisation de l’ordinateur
GPT-5.4 introduit la prise en charge native du fonctionnement informatique, permettant aux agents d’exécuter des flux complexes sur diverses applications. Ele prend en charge jusqu’à 1 million de jetons de contexte pour la planification et la vérification sur de longs horizons. Le modèle se démarque dans des benchmarks tels que OSWorld-Verified, avec un taux de réussite de 75,0 %, et WebArena-Verified, atteignant 67,3 %.
Une perception visuelle améliorée contribue à l’analyse de documents et d’images haute résolution. Sur le MMMU-Pro, la précision atteint 81,2 % sans outils. Les détails d’entrée d’image prennent en charge jusqu’à 2,56 millions de pixels, améliorant ainsi la localisation et la précision des clics.
Avancées en matière de codage et d’efficacité
GPT-5.4 correspond ou dépasse GPT-5.3-Codex sur SWE-Bench Pro, avec une latence plus faible dans les étapes de raisonnement. Le mode /fast dans Codex augmente la vitesse de tokenisation jusqu’à 1,5 fois. Les frontaux complexes Tarefas génèrent des résultats plus esthétiques et fonctionnels.
Une compétence expérimentale appelée Dramaturgo Interativo permet le débogage visuel des applications Web et Electron. Exemplos inclut des simulations de parcs à thème créées à partir d’invites simples, avec des tests automatisés via Playwright.
Améliorations dans l’utilisation des outils et de la recherche
La recherche d’outils API réduit les jetons nécessaires dans de vastes écosystèmes, ce qui permet d’économiser 47 % sur les tâches MCP Atlas. L’appel d’outil agent augmente la précision dans Toolathlon. La recherche Web persistante s’améliore sur BrowseComp, avec une précision de 82,7 %.
GPT-5.4 Thinking décrit son raisonnement sur les requêtes longues, permettant un ciblage sans redémarrage. Ele maintient la cohérence dans les longs flux et réduit les hallucinations, avec 33 % de fausses déclarations en moins et 18 % d’erreurs en moins dans les réponses complètes.
Disponibilité et prix
Le déploiement se fait progressivement sur ChatGPT et Codex. Dans l’API, GPT-5.4 est disponible sous gpt-5.4 et la version Pro sous gpt-5.4-pro. Usuários Plus, Team et Pro accèdent à GPT-5.4 Thinking, en remplacement de GPT-5.2 Thinking, qui reste pendant trois mois. Planos Enterprise et Edu permettent l’accès via les paramètres administratifs.
Le prix reflète des capacités améliorées, mais l’efficacité symbolique est payante dans de nombreuses tâches. Les lots Processamento et Flex coûtent la moitié du prix standard, tandis que la priorité double le prix.







