Justin Uberti et Zahan Malkani, d’OpenAI, ont expliqué comment l’entreprise a réussi à développer GPT‑Live, son système vocal de troisième génération.
Dans un article publié sur le site web d’OpenAI, Uberti et Malkani ont expliqué : "En matière d’IA vocale, savoir quand prendre la parole est plus difficile qu’il n’y paraît. Les locuteurs humains se relaient sans effort en une fraction de seconde, mais les systèmes d’IA vocale précédents ne parvenaient pas à suivre ce rythme. Leur architecture par tours reposait sur de minuscules modèles appelés 'détecteurs de tour", qui devaient faire face à une tâche peu enviable : s’ils devinaient trop tôt, l’utilisateur était interrompu ; s’ils devinaient trop tard, la réponse semblait lente. Ce n’est qu’une fois que le détecteur avait pris sa décision que le LLM, bien plus volumineux, pouvait se mettre au travail. GPT-Live, notre système vocal de troisième génération, supprime le détecteur de tour de parole du chemin audio. Son modèle vocal est en duplex intégral, ce qui signifie qu’il peut écouter et parler en même temps. Cela élimine le besoin d’un détecteur séparé et rend la conversation plus immédiate et naturelle."