OpenAI משיקה את GPT-5.4 עם התמקדות בעבודה מקצועית וסוכנים אוטונומיים
OpenAI השיקה ביום חמישי הקרוב (5) את GPT-5.4, דגם החזית המסוגל והיעיל ביותר שלה שנועד לעבודה מקצועית. המערכת החדשה זמינה ב-ChatGPT כ-GPT-5.4 Thinking, API ו-Codex, ומשלבת התקדמות אחרונה בהיגיון, קידוד וזרימות עבודה סוכניות. גרסת ה-Pro עונה על הדרישות לביצועים מקסימליים במשימות מורכבות. המודל מבצע פעילויות מקצועיות בדיוק רב יותר ופחות צורך בהתאמות, מה שמביא תועלת למשתמשים בסביבות ארגוניות ופיתוח.
GPT-5.4 combines coding features from GPT-5.3-Codex with improvements to tools, software, and tasks involving spreadsheets, presentations, and documents. הוא מספק תוצאות המותאמות לבקשות עם פחות אינטראקציות חוזרות. ב-ChatGPT, GPT-5.4 Thinking מציג תוכנית חשיבה קודמת, המאפשרת התאמות בזמן אמת לתגובות מדויקות יותר. החיפוש באינטרנט צבר עומק בשאילתות ספציפיות ושומר על הקשר בדיאלוגים מורחבים.
ביצועים באמות מידה מקצועיות
GPT-5.4 השיג 83.0% ניצחונות או הגרלות מול אנשי מקצוע בהערכות GDPval, המכסה 44 מקצועות ודורש מוצרים אמיתיים כמו גיליונות אלקטרוניים ומצגות חשבונאיות. שיעור זה עולה על 70.9% של GPT-5.2. מנהלים בחברות כמו מרקור והארווי מדגישים עליונות בתוצאות ארוכות טווח ובניתוח משפטי מורכב.
המודל משפר את היצירה והעריכה של גיליונות אלקטרוניים, עם ציון ממוצע של 87.3% במבחני מידול פיננסי פנימי, לעומת 68.4% לקודמו. מצגות שנוצרו על ידי GPT-5.4 הועדפו ב-68% מהמקרים על ידי מעריכים אנושיים בשל אסתטיקה מעודנת ושימוש יעיל בתמונות.
יכולות שימוש מקוריות במחשב
GPT-5.4 מציג תמיכה מקורית לתפעול מחשב, המאפשר לסוכנים לבצע זרימות מורכבות על פני יישומים מגוונים. הוא תומך בעד מיליון אסימוני הקשר לתכנון ואימות על פני אופקים ארוכים. המודל בולט במדדים כמו OSWorld-Verified, עם שיעור הצלחה של 75.0%, ו-WebArena-Verified, שמגיע ל-67.3%.
תפיסה חזותית משופרת תורמת לניתוח מסמכים ותמונות ברזולוציה גבוהה. ב-MMMU-Pro, הדיוק מגיע ל-81.2% ללא כלים. פרטי קלט תמונה תומך בעד 2.56 מיליון פיקסלים, משפר לוקליזציה ודיוק לחיצות.
התקדמות בקידוד ויעילות
GPT-5.4 תואם או עולה על GPT-5.3-Codex ב-SWE-Bench Pro, עם חביון נמוך יותר בשלבי החשיבה. מצב /מהיר בקודקס מגדיל את מהירות הטוקניזציה עד פי 1.5. משימות חזיתיות מורכבות מייצרות תוצאות אסתטיות ופונקציונליות יותר.
מיומנות ניסיונית בשם Interactive Playwright מאפשרת איתור באגים ויזואלי של אפליקציות אינטרנט ואלקטרון. דוגמאות כוללות סימולציות של פארק שעשועים שנוצרו מהנחיות פשוטות, עם בדיקות אוטומטיות באמצעות Playwright.
שיפורים בשימוש בכלים ובחיפוש
חיפוש אחר כלים ב-API מפחית את האסימונים הדרושים במערכות אקולוגיות רחבות, וחוסך 47% במשימות MCP של Atlas. קריאת כלי סוכן מגבירה את הדיוק ב-Toolathlon. חיפוש מתמשך באינטרנט משתפר ב-BrowseComp, עם דיוק של 82.7%.
GPT-5.4 Thinking מתאר את ההיגיון שלך בשאילתות ארוכות, ומאפשר מיקוד ללא הפעלה מחדש. הוא שומר על קוהרנטיות בזרמים ארוכים ומפחית הזיות, עם 33% פחות הצהרות שגויות ו-18% פחות שגיאות בתגובות מלאות.
זמינות ותמחור
ההשקה מתרחשת בהדרגה ב-ChatGPT וב-Codex. ב-API, GPT-5.4 זמין כ-gpt-5.4 וגרסת ה-Pro כ-gpt-5.4-pro. בנוסף, משתמשי Team ו-Pro ניגשים ל-GPT-5.4 Thinking, ומחליפים את GPT-5.2 Thinking, שנשאר למשך שלושה חודשים. תוכניות Enterprise ו-Edu מאפשרות גישה דרך הגדרות ניהול.
המחיר משקף יכולות משופרות, אך יעילות סמלית משתלמת במשימות רבות. עיבוד אצווה ו-Flex עולה חצי מהסטנדרט, בעוד שהעדיפות מכפילה את המחיר.







