OpenAI breidt stembesturing uit van GPT-Live naar de desktop voor codering
OpenAI, een leider in de ontwikkeling van kunstmatige intelligentie, kondigde op 23 juli 2026 een grote uitbreiding aan van zijn spraakbesturingsmogelijkheden. Het GPT-Live-audiomodel, bekend om zijn naturalistische full-duplex interactie (gelijktijdig luisteren en spreken), is nu rechtstreeks geïntegreerd in de ChatGPT-desktopapplicaties voor macOS en Windows. Deze innovatie heeft tot doel de workflows van ontwikkelaars te transformeren door stembesturing van agentsystemen zoals Codex en ChatGPT Work mogelijk te maken.
Het nieuwe tijdperk van handsfree programmeren
De komst van GPT-Live op computers markeert het begin van een nieuwe fase voor softwareontwikkeling, waardoor ingenieurs codeertaken kunnen orkestreren, pull-aanvragen kunnen beoordelen en applicaties kunnen debuggen met alleen spraakopdrachten. Deze “handsfree” functionaliteit heeft het potentieel om de productiviteit te verhogen en de samenwerking opnieuw te definiëren, vooral voor de meer dan 10 miljoen actieve wekelijkse gebruikers die de Codex- en ChatGPT Work-platforms gebruiken. Codex, dat begon als een op programmeren gericht model, breidde dit jaar uit naar een breder productiviteitsplatform.
Een OpenAI-promotievideo demonstreerde hoe deze integratie werkt, waarbij ingenieurs als Jason Liu en Guinness Chen van het Codex-team in realtime met dezelfde ChatGPT desktop-app-sessie communiceerden. Beiden gaven verschillende instructies en spraken samen met hetzelfde model, waarbij het potentieel voor codeersessies in groepen werd benadrukt.
Meer over dit onderwerp: OpenAI bevestigt de transitie naar agential AI met Codex: het gebruik neemt 189 keer toe onder niet-ingenieurs
Begrijp hoe de GPT-Live-architectuur werkt
De integratie van GPT-Live in de desktopomgeving is gebaseerd op het scheiden van de real-time spraaklaag van de onderliggende uitvoeringsengines. Terwijl GPT-Live een vloeiend gesprek met de gebruiker voert en natuurlijke verbale bevestigingen zoals “Ik begrijp het” invoegt zonder te onderbreken, delegeert het de zwaardere rekenwerklast aan redeneermodellen die op de achtergrond werken, zoals GPT-5.5. Deze structuur zorgt ervoor dat steminteractie wendbaar is, terwijl complexe verwerking efficiënt plaatsvindt.
Op macOS bevat de desktop-app functies zoals “Appshots” en schermcontext. Hierdoor kan ChatGPT Voice het voorgrondvenster analyseren samen met lokale bestanden, codestructuren en actieve plug-ins, waardoor een uitgebreid inzicht wordt geboden in de werkomgeving van de ontwikkelaar. Deze architectuur creëert een ‘paarprogrammering’-dynamiek, waarbij ontwikkelaars problemen mondeling bespreken en agenten taken asynchroon uitvoeren.
In plaats van de codeerstroom te onderbreken om gedetailleerde instructies te typen of tussen vensters te schakelen, kunnen technici het systeem naadloos en handsfree besturen. De full-duplex-engine beslist dynamisch wanneer er moet worden gesproken, gepauzeerd of tools worden aangeroepen, waardoor de gespreksstatus behouden blijft, zelfs terwijl agenten op de achtergrond complexe codewijzigingen verwerken.
Meerdere taken en spraakbeheer op afstand
Een van de kernmogelijkheden van deze update is multitasking in de Codex- en ChatGPT-werkomgevingen. Software-ingenieurs kunnen meerdere taakthreads tegelijkertijd starten met één stemcommando.
- Onderzoek een open authenticatiebug.
- Bekijk een in behandeling zijnde pull-aanvraag voor API-migratie.
- Genereer tegelijkertijd ontbrekende unit-tests.
De desktop-app coördineert deze acties in verschillende contexten en volgt problemen in Slack-gesprekken, GitHub-opslagplaatsen en lokale codebases. Ontwikkelaars kunnen ontwerpschetsen ook mondeling omzetten in werkende code, waarbij taken worden verdeeld over de frontend-, backend- en testlagen. Met ondersteuning voor projecten met meerdere mappen (vanaf build 26.715) en uitvoering op afstand via iOS kunnen technici de voortgang van taken controleren, reageren op prompts van agenten en actief werk omleiden zonder tussen applicaties te hoeven schakelen of processen regel voor regel te hoeven beheren.
Licenties en exclusieve toegang tot nieuwe technologie
Belangrijk is dat de spraakgestuurde desktopversie van OpenAI opereert onder een eigen, commercieel en ondernemingsmodel. Toegang tot deze functies is beperkt tot betalende abonnees van de Plus-, Pro-, Business-, Enterprise- en Education-abonnementen.
Lees meer: Tiener vermoordt moeder en broer nadat ze AI heeft gebruikt om fantasieën over de misdaad te creëren
Voor individuele ontwikkelaars en bedrijfstechnische afdelingen impliceert deze bedrijfsstructuur dat AI-modellen, spraakverwerkingspijplijnen en agent-state-architecturen volledig gesloten blijven. Organisaties kunnen de onderliggende systemen niet wijzigen of zelf hosten. Bovendien verbruiken taken die via ChatGPT Voice worden gelanceerd standaardgebruikstoewijzingen rechtstreeks uit bestaande Codex- en ChatGPT-werkplanquota’s, waarbij spraakgestuurde acties op dezelfde manier worden behandeld als standaard werklasten van agenten.
Reacties van de gemeenschap en de toekomst van kunstmatige intelligentie
De ontwikkelaarsgemeenschap reageerde onmiddellijk op de implicaties van het toevoegen van continue, full-duplex stem aan onbeheerde codeerworkflows. De aankondiging van build 26.715, waarin spraakintegratie en ondersteuning voor projecten met meerdere mappen wordt beschreven, zorgde voor grote opwinding.
Een journalist gespecialiseerd in kunstmatige intelligentie, ChrisGPT, reageerde op een sociaal platform over de lancering: “Vandaag lanceert OpenAI stembegeleiding en begeleiding op afstand voor Codex! Een stap dichter bij persoonlijke AGI.” Uit de eerste technische feedback blijkt een breed enthousiasme voor de mogelijkheid om complexe agenttaken handsfree te orkestreren, vooral in situaties waarin de ontwikkelaar niet achter het werkstation zit of bouwpijplijnen op afstand beheert. De verwachting is dat deze technologie nieuwe horizonten opent voor samenwerking en efficiëntie op het gebied van programmeren.















