GPT Transcribe expliqué : la transcription vocale OpenAI pour un audio précis

Comprenez comment GPT Transcribe convertit des enregistrements en texte précis, comment fonctionne l’API de transcription d’OpenAI et quand un modèle spécialisé reste nécessaire.

30 juil. 2026
Relu par Mazza Will
GPT Transcribe expliqué : la transcription vocale OpenAI pour un audio précis

GPT Transcribe est le modèle de transcription vocale qu’OpenAI recommande pour convertir des enregistrements déjà terminés en texte dans leur langue d’origine. Il est conçu pour des fichiers audio téléversés, des résultats de transcription diffusés à mesure que des fichiers complets sont traités et des segments audio validés dans des sessions Realtime par WebSocket. Ce périmètre le rend utile pour les réunions, les entretiens, les podcasts, les appels de support, les enregistrements de recherche et tout produit qui a besoin d’un texte consultable à partir de la parole.

Le détail qui compte est le nom exact du modèle : gpt-transcribe. Ce n’est pas un raccourci de gpt-4o-transcribe, ni un modèle ChatGPT général qui accepterait soudain un MP3. OpenAI le documente comme un modèle de transcription dédié et de haute précision, avec des entrées audio et texte, une sortie texte, des indices de contexte, un guidage multilingue, la détection de langue et le support du streaming. Ce guide explique ce que ces capacités signifient en pratique — et où un autre modèle reste le bon choix.

Sources et détails du produit relus le 30 juillet 2026. Revérifiez la disponibilité du modèle, les tarifs, les limites et les contrôles de données avant de déplacer du trafic de production.

Points clés

  • Commencez par gpt-transcribe pour un enregistrement terminé qui doit rester dans sa langue d’origine.
  • Envoyez les fichiers vers POST /v1/audio/transcriptions ; la réponse contient le texte de la transcription et les langues que le modèle peut détecter de façon fiable.
  • Utilisez prompt, keywords et languages comme contexte pertinent, pas comme consignes pour inventer du contenu.
  • Diffuser en streaming la transcription d’un fichier déjà complet n’est pas la même chose que transcrire sans arrêt un microphone en direct.
  • Réservez des parcours spécialisés pour les étiquettes de locuteur, les horodatages par mot, les fichiers de sous-titres et la traduction vers l’anglais.
  • Évaluez les noms, les chiffres, les omissions, les changements de langue, la latence et les insertions fausses avec votre propre audio avant de déployer.

Qu’est-ce que GPT Transcribe ?

GPT Transcribe est un modèle de reconnaissance automatique de la parole. Son rôle est plus ciblé que celui d’un modèle conversationnel : recevoir un enregistrement audio, éventuellement accompagné d’un contexte textuel, et renvoyer une transcription écrite. La fiche officielle du modèle GPT Transcribe liste l’audio et le texte comme modalités d’entrée, le texte comme modalité de sortie, et à la fois la transcription et la transcription Realtime comme points de terminaison pris en charge.

Le nom « GPT » compte parce que l’interface peut utiliser un contexte linguistique qu’un système acoustique traditionnel traiterait à part. Une requête peut décrire l’enregistrement, lister des termes susceptibles d’apparaître mot pour mot et identifier plusieurs langues attendues. OpenAI, toutefois, n’a pas publié d’architecture détaillée ni de méthode d’entraînement dans la fiche du modèle. Affirmer un nombre de paramètres internes, la taille du jeu de données, la conception du décodeur ou une précision universelle relèverait donc de la spéculation.

La définition pratique est plus utile :

GPT Transcribe est un modèle de transcription vocale qui exploite le contexte pour transcrire avec précision des fichiers et des segments audio validés, avec une sortie principalement en JSON et des métadonnées sur les langues détectées.

Cette définition évite aussi une erreur de nommage fréquente. gpt-transcribe, gpt-4o-transcribe, gpt-4o-mini-transcribe, gpt-4o-transcribe-diarize, gpt-live-transcribe et whisper-1 sont des choix de modèle distincts. Ils se recoupent, mais leurs meilleurs flux et sorties prises en charge ne sont pas identiques.

Où il s’inscrit dans la pile de transcription vocale d’OpenAI

La documentation actuelle d’OpenAI recommande de commencer par le modèle qui correspond au cycle de vie de l’audio et à la sortie exigée. La décision ne se résume pas à l’opposition « nouveau modèle contre ancien modèle ».

ExigencePoint de départ recommandéPourquoi
Enregistrement terminé dans sa langue d’originegpt-transcribeTranscription générale de fichier, indices de contexte, langues détectées et texte en streaming
Audio de micro, d’appel ou de média qui arrive sans arrêtgpt-live-transcribeTranscription à faible latence au fur et à mesure que l’audio arrive
Étiquettes de locuteur sur un enregistrement terminégpt-4o-transcribe-diarizeRenvoie des segments avec locuteur dans diarized_json
Horodatages par mot ou par segmentwhisper-1Prend en charge la granularité d’horodatage avec verbose_json
Sortie native de sous-titres SRT ou VTTwhisper-1Prend en charge les formats de réponse sous-titres de façon directe
Traduction de la parole enregistrée vers l’anglaiswhisper-1 sur /v1/audio/translationsParcours dédié de l’audio vers l’anglais

Cette distinction passe souvent inaperçue parce que « streaming » décrit deux choses distinctes. Un fichier peut déjà exister sur disque pendant que l’API renvoie des événements partiels de transcription à l’application. La transcription en direct est autre chose : l’audio du micro ou de l’appel continue d’arriver et le système doit gérer une session Realtime en cours. Le guide de migration de Whisper vers GPT d’OpenAI conseille explicitement de traiter l’audio en direct et la sortie en streaming comme des décisions séparées.

Pour une description brève, destinée à une consultation dans le navigateur, du modèle et de ses limites pratiques, la vue d’ensemble du modèle GPT Transcribe est un complément utile à la documentation de l’API.

Comment fonctionne /v1/audio/transcriptions

Pour un fichier terminé, l’intégration reste volontairement simple. L’application ouvre le fichier audio, l’envoie en données multipart, choisit gpt-transcribe et reçoit du JSON.

curl --request POST \
  --url https://api.openai.com/v1/audio/transcriptions \
  --header "Authorization: Bearer $OPENAI_API_KEY" \
  --header "Content-Type: multipart/form-data" \
  --form file=@/path/to/meeting.mp3 \
  --form model=gpt-transcribe

Une réponse correcte peut inclure à la fois le texte et les langues détectées :

{
  "text": "Bonjour, can everyone see the AC-42 billing record?",
  "languages": [{ "code": "fr" }, { "code": "en" }]
}

La détection de langue est une métadonnée probabiliste, pas un écho obligatoire des indices envoyés par l’appelant. Un tableau languages vide est valide lorsque le modèle ne peut pas faire de prédiction fiable ; à lui seul, il ne signifie pas que l’audio était silencieux ni que la requête a échoué.

Le guide de transcription vocale d’OpenAI limite aujourd’hui un téléversement vers l’API Transcriptions à 25 Mo et résume la prise en charge de MP3, MP4, MPEG, MPGA, M4A, WAV et WebM. La référence actuelle du point de terminaison liste en plus FLAC et OGG. Comme les résumés de guide et les schémas de point de terminaison peuvent évoluer à des moments différents, consultez la référence de l’API Create transcription lors de l’implémentation de la validation, plutôt que de copier une liste statique de formats dans une promesse permanente sur le produit.

Le contexte est le principal levier de contrôle du modèle

Les vrais enregistrements sont remplis de mots faciles à mal entendre et coûteux à rater : identifiants client, noms de médicaments, numéros de modèle, personnes, organisations, acronymes et phrases en plusieurs langues. GPT Transcribe sépare trois types de contexte.

prompt : décrire l’enregistrement

Un prompt est un contexte libre sur le cadre ou le sujet. Un prompt utile pourrait dire :

A customer support call about enterprise billing and an account migration.
Preserve filler words because the transcript will be used for conversation research.

Cela indique au modèle dans quel contexte linguistique il opère. Le prompt peut aussi préciser des préférences de mise en forme ou transmettre le contexte du segment précédent d’un long enregistrement. Il ne devrait pas contenir une transcription inventée ni demander au modèle de résumer ; la transcription et le post-traitement sont deux tâches distinctes.

keywords : fournir des termes littéraux

Les mots-clés sont des mots ou des phrases qui peuvent vraiment apparaître dans l’enregistrement :

["AC-42", "Premium Plus", "ZyntriQix", "SOC 2"]

Ce sont des indices, pas une sortie obligatoire. Cette distinction est opérationnelle. Une liste de terminologie peut améliorer le rappel, mais une liste hors sujet ou trop longue peut biaiser la reconnaissance vers un mot que personne n’a prononcé. OpenAI recommande d’évaluer explicitement l’hallucination de mots-clés : la transcription ne devrait contenir un mot-clé que lorsque l’audio le justifie.

languages : identifier les langues attendues

Le tableau languages peut décrire de l’audio multilingue et des changements de code. La documentation actuelle accepte des codes ISO 639-1 comme en, es et fr, certains codes ISO 639-3 et des codes régionaux de chinois comme zh-cn, zh-tw et zh-hk.

C’est un détail de migration autant qu’une fonction. gpt-transcribe utilise le champ au pluriel languages. Des modèles plus anciens peuvent utiliser le champ au singulier language. N’envoyez pas les deux en supposant que le serveur en choisira un ; le guide actuel indique que l’API refuse les valeurs incompatibles ou mal formées.

Une conversation de podcast multilingue capturée pour une analyse de transcription vocale

Diffuser un fichier terminé n’est pas de la transcription en direct

Mettez stream=true lorsque le fichier audio est déjà complet, mais que l’interface doit afficher du texte au fur et à mesure du traitement. GPT Transcribe émet des événements transcript.text.delta et termine avec transcript.text.done.

Cela peut améliorer la sensation de réactivité sur un long entretien. L’utilisateur voit les premiers paragraphes avant que le résultat complet soit prêt, tandis que l’application conserve un événement final clair pour enregistrer, indexer ou activer des actions en aval.

Cela ne transforme pas /v1/audio/transcriptions en un microphone ouvert. Le fichier entier est fourni avec la requête. Pour une source en cours, OpenAI oriente les développeurs vers la transcription Realtime et recommande gpt-live-transcribe pour un travail continu à faible latence.

Il existe une voie intermédiaire avancée : gpt-transcribe peut s’exécuter dans une session de transcription Realtime par WebSocket après que l’application a validé manuellement un segment audio. C’est utile lorsque la précision obtenue après une prise délimitée compte davantage que des sous-titres continus. L’application ajoute l’audio, valide le tampon et reçoit des résultats partiels, puis un événement signalant la fin de la transcription du segment.

Cela donne aux équipes produit trois schémas d’interaction distincts :

  1. Transcription de fichier bloquante : téléversez un enregistrement terminé et attendez le JSON final.
  2. Résultat de fichier en streaming : téléversez un enregistrement terminé et affichez les résultats partiels de la transcription.
  3. Transcription Realtime : envoyez de l’audio sur une connexion en cours, de façon continue avec un modèle live ou par segments confirmés manuellement.

Bien nommer ces schémas évite des surprises d’architecture plus tard.

Ce que signifie la précision en production

Il n’existe pas de chiffre honnête et universel de précision pour la transcription vocale. Le taux d’erreur de mot change avec la langue, l’accent, la distance au micro, le codec, le bruit, le chevauchement, le vocabulaire, le comportement du locuteur et les règles de ponctuation ou de casse utilisées pour normaliser. Un banc d’essai sur une narration anglaise propre ne prédit pas la performance d’un appel de support bilingue enregistré sur un canal téléphonique de 8 kHz.

GPT Transcribe devrait donc être évalué comme un composant d’un flux concret, pas comme une étiquette de classement. Constituez un petit jeu d’évaluation autorisé qui représente l’audio que les utilisateurs enverront vraiment. Conservez la transcription de référence approuvée par un humain et comparez au moins trois configurations :

  • la ligne de base de production actuelle ;
  • un changement de modèle seulement vers gpt-transcribe ;
  • gpt-transcribe avec des indices pertinents de prompt, de mots-clés et de langue.

Mesurez plus que le taux d’erreur de mot agrégé :

Dimension d’évaluationCe qu’il faut vérifier
ComplétudePhrases manquantes, fins tronquées et passages peu audibles omis
Entités critiquesCorrespondance exacte des noms, chiffres, e-mails, médicaments, SKU et ID de compte
Comportement de langueÉcriture correcte, changement de code, formulation traduite versus originale et langues détectées
RobustesseAccents, musique de fond, réverbération, locuteurs superposés et audio téléphonique
Discipline des indicesSi les mots-clés fournis n’apparaissent que lorsqu’ils ont vraiment été prononcés
Comportement de streamingDélai jusqu’au premier delta, délai jusqu’au texte final, révisions partielles et ordre des événements
Résilience opérationnelleAudio vide, fichiers endommagés, nouvelles tentatives, déconnexions et gestion des envois dupliqués

N’« améliorez » pas une transcription d’évaluation avec un modèle de texte général avant de la noter. Le post-traitement peut créer un document plus lisible et, en silence, changer les mots du locuteur. Conservez une couche verbatim, puis dérivez une couche nettoyée ou résumée avec une piste d’audit.

Ce que GPT Transcribe ne remplace pas

La valeur par défaut la plus récente n’est pas, automatiquement, le modèle le plus complet en fonctions pour chaque sortie.

Diarisation des locuteurs

Si le produit doit répondre « qui a dit quoi », utilisez gpt-4o-transcribe-diarize. Sa réponse diarized_json contient des segments avec locuteur et des métadonnées de début et de fin. Pour les enregistrements de plus de 30 secondes, OpenAI exige une stratégie de découpage automatique ou configurée. Le modèle peut aussi accepter de courts échantillons de référence pour un nombre limité de locuteurs connus, mais l’étiquetage des locuteurs n’est pas pris en charge dans les sessions de transcription Realtime.

Horodatages par mot et sous-titres

La sortie principalement en JSON de GPT Transcribe ne remplace pas directement tous les formats de réponse de Whisper. Si un monteur dépend d’horodatages au niveau du mot, d’horodatages de segment, de SRT, de VTT ou de verbose_json, conservez whisper-1 ou construisez et validez une couche séparée d’alignement et de sous-titres. Ne fabriquez pas de codes temporels en répartissant les mots de façon uniforme sur la durée du fichier.

Traduction

La transcription conserve la langue originale parlée. La traduction change de langue. Le parcours OpenAI pour des enregistrements terminés vers l’anglais reste /v1/audio/translations avec whisper-1. Pour d’autres flux de traduction, séparez reconnaissance et traduction afin que chaque étape puisse être relue.

Longueur d’entrée illimitée

La limite de téléversement de 25 MB n’est pas une promesse de durée. Un enregistrement mono compressé peut contenir bien plus de minutes qu’un WAV stéréo non compressé. Pour des entrées plus grandes, compressez avec discernement ou découpez sur des limites sémantiques. Couper au milieu d’une phrase retire du contexte acoustique et linguistique, et des morceaux qui se chevauchent sans stratégie de réconciliation peuvent dupliquer des mots.

Coût et débit

La page de tarifs d’OpenAI listait gpt-transcribe à 0,0045 $ par minute lorsque cet article a été relu. Cela représente environ 0,27 $ pour une heure d’audio source, avant stockage, réseau, orchestration, nouvelles tentatives, post-traitement et relecture humaine.

Le prix par minute n’est qu’une partie du coût de production. Incluez :

  • les téléversements échoués ou répétés ;
  • la normalisation et le découpage des médias ;
  • le stockage des fichiers source et des transcriptions approuvées ;
  • la gestion de la terminologie ;
  • la relecture qualité pour le contenu à fort impact ;
  • le résumé, la recherche ou le caviardage de données sensibles en aval ;
  • la résidence des données ou les contrôles d’entreprise lorsqu’ils s’appliquent.

Un modèle moins cher peut coûter cher s’il augmente le temps de correction. Un modèle plus précis peut rester le mauvais choix si le flux exige des sous-titres natifs ou des sous-titres continus en direct. Comparez le coût total du flux aux exigences de sortie, pas seulement au tarif affiché pour le modèle.

Confidentialité et traitement responsable

Les enregistrements contiennent souvent des informations plus sensibles que le texte ordinaire : voix, indices d’identité, conversations de fond, adresses, données de santé et réunions confidentielles. Obtenez un droit valable d’enregistrer et de traiter l’audio, minimisez ce que vous collectez, protégez le fichier source et fixez un calendrier de suppression.

La documentation actuelle des contrôles de données de l’API d’OpenAI indique que les données envoyées par API ne servent pas à entraîner les modèles, sauf si le client choisit explicitement de les partager. Son tableau des points de terminaison indique que /v1/audio/transcriptions ne conserve ni état applicatif ni données à des fins de surveillance des abus, et qu’il est compatible avec l’option Zero Data Retention. Ce sont des engagements au niveau de la plateforme, pas un programme de confidentialité complet. Votre outil de téléversement, le stockage d’objets, les journaux, les outils d’analyse et de support ainsi que les services de traitement en aval ont leurs propres politiques et durées de conservation.

Pour un travail réglementé ou à haut risque, confirmez auprès des équipes juridiques et de sécurité responsables les exigences contractuelles, régionales, de sécurité et de relecture humaine en vigueur. Ne traitez jamais une transcription automatique comme le seul enregistrement d’une décision qui pourrait affecter matériellement une personne.

Une architecture de transcription prête pour la production

Un développeur ou une développeuse teste une API de transcription audio

Une implémentation fiable sépare l’importation, la transcription, la relecture et le contenu dérivé :

  1. Autorisez et importez. Validez l’utilisateur, les droits d’enregistrement, le type de média, la taille de fichier et la détection des logiciels malveillants.
  2. Normalisez le média. Convertissez les conteneurs non pris en charge, conservez une copie source lorsque c’est nécessaire et évitez les réencodages avec perte inutiles.
  3. Joignez un contexte ciblé. Choisissez seulement les langues, les mots-clés et la description de l’enregistrement pertinents pour ce travail.
  4. Transcrivez de façon idempotente. Donnez à chaque source un ID de travail stable pour qu’une nouvelle tentative ne crée pas de travail facturable dupliqué ni de transcriptions en conflit.
  5. Enregistrez le résultat brut. Conservez la réponse exacte du modèle, l’ID du modèle, les champs de contexte, la somme de contrôle de la source et la date de traitement.
  6. Relisez les champs critiques. Passez à une personne les noms, chiffres, engagements et le langage médical ou juridique de faible confiance ou à fort impact.
  7. Créez des contenus dérivés. Générez des résumés, chapitres, sous-titres, index de recherche, versions anonymisées ou actions à mener à partir de la transcription approuvée.
  8. Appliquez la conservation. Supprimez ou archivez l’audio source et les dérivés selon la politique documentée.

La transcription peut aussi être la première moitié d’un flux audio bidirectionnel. Une fois la transcription corrigée, l’équipe peut la relire et utiliser la synthèse vocale pour créer une narration accessible, des brouillons de localisation ou une voix off approuvée. Étiquetez clairement la source reconnue et la sortie générée : l’une est la preuve de ce qui a été dit ; l’autre est un média nouvellement synthétisé.

Intégration d’API face à un outil dans le navigateur

Utilisez l’API lorsque la transcription fait partie d’un produit, d’une automatisation, d’un pipeline de données ou d’un processus interne répétable. Elle offre le contrôle de l’authentification, du contexte, du suivi des travaux, du stockage en aval et de la gestion des erreurs.

Il n’est pas toujours nécessaire de commencer par une intégration. Un outil dans le navigateur sert à tester quelques enregistrements représentatifs, à comprendre les sorties attendues ou à répondre au besoin ponctuel d’un utilisateur qui privilégie les formats d’export au code SDK. L’espace de travail en ligne de transcription vocale GPT Transcribe offre un parcours pratique de téléversement et de relecture avant qu’une équipe s’engage à construire sa propre interface.

Le critère d’évaluation devrait être le même sur l’un ou l’autre parcours : utilisez de l’audio que vous êtes autorisé à traiter, comparez à une référence humaine, inspectez les entités critiques et comprenez quelle application — pas seulement quel modèle sous-jacent — crée les horodatages, étiquettes de locuteur, exports ou stockage.

Quand devriez-vous choisir GPT Transcribe ?

Choisissez gpt-transcribe lorsque :

  • l’entrée est un enregistrement terminé ou un segment audio délimité et validé ;
  • la sortie souhaitée est un texte précis dans la langue d’origine ;
  • l’enregistrement peut changer entre des langues attendues ;
  • le vocabulaire de domaine peut bénéficier de mots-clés ciblés ;
  • les métadonnées de langue détectée sont utiles ;
  • les événements partiels de transcription amélioreraient l’interface de traitement des fichiers.

Choisissez une alternative spécialisée lorsque :

  • l’audio arrive de façon continue et la faible latence est essentielle ;
  • il faut étiqueter les locuteurs ;
  • les horodatages au niveau du mot ou les fichiers natifs de sous-titres sont obligatoires ;
  • la sortie doit être une traduction vers l’anglais ;
  • une intégration existante dépend d’un format de réponse que gpt-transcribe n’offre pas.

La sélection correcte repose sur le livrable dont vous avez besoin. « Une transcription » peut signifier du texte brut, un objet JSON consultable, des sous-titres synchronisés à la vidéo, un registre de locuteurs de type judiciaire ou des sous-titres en direct. Ce sont des produits distincts même s’ils commencent tous par la reconnaissance de la parole.

Questions fréquentes

GPT Transcribe est-il la même chose que GPT-4o Transcribe ?

Non. gpt-transcribe est un ID de modèle actuel distinct et le point de départ qu’OpenAI recommande pour la transcription ordinaire de fichiers. Les intégrations existantes de gpt-4o-transcribe peuvent continuer de fonctionner, mais il ne faut pas supposer que leurs champs de requête, tarifs et comportement de sortie coïncident.

GPT Transcribe peut-il transcrire un MP3 ou un fichier vidéo ?

Oui. Le point de terminaison de transcription de fichiers accepte des conteneurs audio et multimédias courants. Vérifiez la liste actuelle d’entrées et la limite de requête de 25 Mo dans la référence de l’API, surtout lors de la validation de FLAC, OGG ou de conteneurs vidéo.

GPT Transcribe identifie-t-il des locuteurs distincts ?

Pas à lui seul. Utilisez gpt-4o-transcribe-diarize et demandez diarized_json lorsque des segments étiquetés par locuteur sont nécessaires.

Peut-il créer des sous-titres SRT ou VTT ?

Pas comme une sortie native GPT Transcribe prête à l’emploi. OpenAI oriente aujourd’hui les flux d’horodatage et de SRT/VTT natifs vers whisper-1, ou vous pouvez construire une couche d’alignement testée séparément.

GPT Transcribe peut-il traiter l’audio d’un microphone en direct ?

Pour de l’audio qui arrive de façon continue, utilisez le flux de transcription Realtime et commencez par gpt-live-transcribe. GPT Transcribe peut servir pour des segments confirmés manuellement par WebSocket, ce qui est distinct de sous-titres en direct ininterrompus.

Comment améliorer la transcription des noms et des termes techniques ?

Décrivez l’enregistrement avec prompt, apportez les termes littéraux attendus via keywords et fournissez les languages attendus. Vérifiez que les indices améliorent le rappel sans insérer des termes jamais prononcés.

GPT Transcribe est-il gratuit ?

L’API OpenAI est facturée à l’usage. À la date de relecture, le tarif officiel listait 0,0045 $ par minute d’audio pour gpt-transcribe. Une interface tierce peut offrir son propre essai, crédits, limites ou abonnement.

La valeur par défaut utile, pas la réponse universelle

GPT Transcribe donne aux nouveaux projets de transcription vocale OpenAI une valeur par défaut solide : un modèle pour transcrire avec précision de l’audio enregistré, du contexte multilingue, la détection de langue et des résultats de fichier en streaming. Son vrai avantage n’est pas de rendre toutes les routes précédentes obsolètes. Il offre à qui développe un chemin général plus clair et laisse les travaux spécialisés aux modèles spécialisés.

Définissez d’abord la sortie exigée. Ensuite, testez gpt-transcribe sur les enregistrements les plus bruyants, les plus multilingues et les plus chargés de terminologie que les utilisateurs enverront. Une transcription qui survit à ces cas — avec un contexte traçable, une relecture humaine et des limites claires — est prête à faire partie d’un produit, pas seulement d’une démonstration impressionnante.

Eleven AI Editorial

Eleven AI Editorial