GPT Transcribe es el modelo de voz a texto que OpenAI recomienda para convertir grabaciones ya terminadas en texto en su idioma original. Está pensado para archivos de audio subidos, resultados de transcripción en streaming a partir de archivos completos y turnos de audio confirmados en sesiones Realtime por WebSocket. Ese alcance lo hace útil en reuniones, entrevistas, pódcast, llamadas de soporte, grabaciones de investigación y cualquier producto que necesite texto que se pueda buscar a partir del habla.
El detalle que importa es el nombre exacto del modelo: gpt-transcribe. No es un atajo de gpt-4o-transcribe ni un modelo general de ChatGPT que de pronto acepta un MP3. OpenAI lo documenta como un modelo de transcripción dedicado y de alta precisión, con entradas de audio y texto, salida de texto, pistas de contexto, guía multilingüe, detección de idioma y soporte de streaming. Esta guía explica qué significan esas capacidades en la práctica —y dónde otro modelo sigue siendo la elección correcta.
Fuentes y detalles de producto revisados el 30 de julio de 2026. Vuelve a comprobar disponibilidad de modelo, precios, límites y controles de datos antes de mover tráfico de producción.
Ideas clave
- Empieza con
gpt-transcribepara una grabación terminada que debe quedarse en su idioma original. - Envía los archivos a
POST /v1/audio/transcriptions; la respuesta contiene el texto de la transcripción y los idiomas que el modelo puede detectar con fiabilidad. - Usa
prompt,keywordsylanguagescomo contexto pertinente, no como instrucciones para inventar contenido. - Transmitir en streaming la transcripción de un archivo ya completo no es lo mismo que transcribir sin parar un micrófono en directo.
- Reserva rutas especializadas para etiquetas de hablante, marcas de tiempo por palabra, archivos de subtítulos y traducción al inglés.
- Evalúa nombres, números, omisiones, cambios de idioma, latencia e inserciones falsas con tu propio audio antes de desplegar.
¿Qué es GPT Transcribe?
GPT Transcribe es un modelo de reconocimiento automático del habla. Su trabajo central es más estrecho que el de un modelo conversacional: recibir audio hablado más un contexto textual opcional y devolver una transcripción escrita. La ficha oficial del modelo GPT Transcribe lista audio y texto como modalidades de entrada, texto como modalidad de salida, y tanto transcripción como transcripción Realtime como endpoints soportados.
El nombre «GPT» importa porque la interfaz puede usar contexto lingüístico que un pipeline acústico tradicional trataría por separado. Una petición puede describir la grabación, listar términos literales que es probable que aparezcan e identificar varios idiomas esperados. OpenAI, sin embargo, no ha publicado una arquitectura detallada ni una receta de entrenamiento en la ficha del modelo. Afirmar un recuento interno de parámetros, el tamaño del conjunto de datos, el diseño del decodificador o una precisión universal sería especulación.
La definición práctica es más útil:
GPT Transcribe es un modelo de voz a texto con contexto para transcribir archivos con precisión y turnos de audio confirmados, con una salida centrada en JSON y metadatos de idiomas detectados.
Esa definición también evita un error habitual de nombres. gpt-transcribe, gpt-4o-transcribe, gpt-4o-mini-transcribe, gpt-4o-transcribe-diarize, gpt-live-transcribe y whisper-1 son elecciones de modelo distintas. Se solapan, pero sus mejores flujos y salidas soportadas no son idénticos.
Dónde encaja en la pila de voz a texto de OpenAI
La documentación actual de OpenAI recomienda empezar por el modelo que coincida con el ciclo de vida del audio y con la salida exigida. La decisión no es simplemente «modelo nuevo frente a modelo viejo».
| Requisito | Punto de partida recomendado | Por qué |
|---|---|---|
| Grabación terminada en su idioma original | gpt-transcribe | Transcripción general de archivo, pistas de contexto, idiomas detectados y texto en streaming |
| Audio de micrófono, llamada o medio que llega sin parar | gpt-live-transcribe | Transcripción de baja latencia a medida que llega el audio |
| Etiquetas de hablante en una grabación terminada | gpt-4o-transcribe-diarize | Devuelve segmentos con hablante en diarized_json |
| Marcas de tiempo por palabra o por segmento | whisper-1 | Admite granularidad de marcas de tiempo con verbose_json |
| Salida nativa de subtítulos SRT o VTT | whisper-1 | Admite formatos de respuesta de subtítulos de forma directa |
| Traducción del habla grabada al inglés | whisper-1 en /v1/audio/translations | Ruta dedicada de audio a inglés |
Esta distinción se pasa por alto porque «streaming» describe dos cosas distintas. Un archivo ya puede existir en disco mientras la API envía de vuelta eventos parciales de transcripción a la aplicación. La transcripción en directo es otra cosa: el audio del micrófono o de la llamada sigue llegando y el sistema tiene que gestionar una sesión Realtime en curso. La guía de migración de Whisper a GPT de OpenAI aconseja de forma explícita tratar el audio en directo y la salida en streaming como decisiones separadas.
Para una descripción breve, orientada al navegador, del modelo y de sus límites prácticos, la visión general del modelo GPT Transcribe es un compañero útil de la documentación de la API.
Cómo funciona /v1/audio/transcriptions
Para un archivo terminado, la integración sigue siendo deliberadamente simple. La aplicación abre el archivo de audio, lo envía como datos multipart, elige gpt-transcribe y recibe JSON.
curl --request POST \
--url https://api.openai.com/v1/audio/transcriptions \
--header "Authorization: Bearer $OPENAI_API_KEY" \
--header "Content-Type: multipart/form-data" \
--form file=@/path/to/meeting.mp3 \
--form model=gpt-transcribeUna respuesta correcta puede incluir tanto el texto como los idiomas detectados:
{
"text": "Bonjour, can everyone see the AC-42 billing record?",
"languages": [{ "code": "fr" }, { "code": "en" }]
}La detección de idioma es un metadato probabilístico, no un eco obligatorio de las pistas que envió quien llama. Un array languages vacío es válido cuando el modelo no puede hacer una predicción fiable; por sí solo no significa que el audio estuviera en silencio ni que la petición fallara.
La guía de voz a texto de OpenAI limita hoy una subida a la API de Transcriptions a 25 MB y resume el soporte de MP3, MP4, MPEG, MPGA, M4A, WAV y WebM. La referencia actual del endpoint lista además FLAC y OGG. Como los resúmenes de guía y los esquemas del endpoint pueden evolucionar en momentos distintos, consulta la referencia de la API Create transcription al implementar validación, en lugar de copiar una lista estática de formatos a una promesa permanente de producto.
El contexto es la superficie de control más importante del modelo
Las grabaciones reales están llenas de palabras fáciles de oír mal y caras de fallar: identificadores de cliente, nombres de fármacos, números de modelo, personas, organizaciones, acrónimos y frases en varios idiomas. GPT Transcribe separa tres tipos de contexto.
prompt: describe la grabación
Un prompt es contexto libre sobre el entorno o el tema. Un prompt útil podría decir:
A customer support call about enterprise billing and an account migration.
Preserve filler words because the transcript will be used for conversation research.Eso le dice al modelo en qué vecindario lingüístico está operando. También puede indicar preferencias de formato o arrastrar contexto del tramo anterior de una grabación larga. No debería contener una transcripción fabricada ni pedir al modelo que resuma; transcribir y posprocesar son tareas distintas.
keywords: aporta términos literales
Los keywords son palabras o frases que pueden aparecer de verdad en la grabación:
["AC-42", "Premium Plus", "ZyntriQix", "SOC 2"]Son pistas, no salida obligatoria. Esa distinción es operativa. Una lista de terminología puede mejorar la recuperación, pero una lista irrelevante o desmesurada puede sesgar el reconocimiento hacia una palabra que nadie pronunció. OpenAI recomienda evaluar de forma explícita la alucinación de keywords: la transcripción solo debería contener un keyword cuando el audio lo sostenga.
languages: identifica los idiomas esperados
El array languages puede describir audio multilingüe y cambios de código. La documentación actual acepta códigos ISO 639-1 como en, es y fr, algunos códigos ISO 639-3 y códigos regionales de chino como zh-cn, zh-tw y zh-hk.
Es un detalle de migración además de una función. gpt-transcribe usa el campo en plural languages. Modelos más antiguos pueden usar el campo en singular language. No envíes ambos y asumas que el servidor elegirá uno; la guía actual dice que la API rechaza valores incompatibles o mal formados.

Transmitir un archivo terminado no es transcripción en directo
Pon stream=true cuando el archivo de audio ya está completo, pero la interfaz debería mostrar texto a medida que avanza el procesamiento. GPT Transcribe emite eventos transcript.text.delta y termina con transcript.text.done.
Eso puede mejorar la sensación de respuesta en una entrevista larga. La persona usuaria ve los primeros párrafos antes de que el resultado completo esté listo, mientras la aplicación sigue teniendo un evento final claro para guardar, indexar o habilitar acciones posteriores.
No convierte /v1/audio/transcriptions en un micrófono abierto. El archivo entero se suministra con la petición. Para una fuente en curso, OpenAI dirige a desarrolladores a la transcripción Realtime y recomienda gpt-live-transcribe para trabajo continuo de baja latencia.
Hay un camino intermedio avanzado: gpt-transcribe puede correr en una sesión de transcripción Realtime por WebSocket después de que la aplicación confirme a mano un turno de audio. Es útil cuando la precisión tras un enunciado acotado importa más que unos subtítulos continuos. La aplicación añade audio, confirma el búfer y recibe deltas seguidos de un evento de transcripción completada para ese turno.
Eso da a los equipos de producto tres patrones de interacción distintos:
- Transcripción de archivo bloqueante: sube una grabación terminada y espera el JSON final.
- Resultado de archivo en streaming: sube una grabación terminada y renderiza los deltas de transcripción.
- Transcripción Realtime: envía audio por una conexión en curso, de forma continua con un modelo en directo o en turnos confirmados a mano.
Nombrar bien estos patrones evita sorpresas de arquitectura más adelante.
Qué significa precisión en producción
No hay un número honesto y universal de precisión para voz a texto. La tasa de error de palabra cambia con el idioma, el acento, la distancia al micrófono, el códec, el ruido, el solapamiento, el vocabulario, el comportamiento del hablante y las reglas de puntuación o mayúsculas usadas para normalizar. Un banco de pruebas sobre narración limpia en inglés no predice el rendimiento de una llamada de soporte bilingüe grabada por un canal telefónico de 8 kHz.
GPT Transcribe debería evaluarse, por tanto, como un componente de un flujo concreto, no como una etiqueta de ranking. Construye un conjunto pequeño y autorizado de evaluación que represente el audio que las personas usuarias van a enviar de verdad. Conserva la transcripción de referencia aprobada por un humano y compara al menos tres configuraciones:
- la línea base de producción actual;
- un cambio solo de modelo a
gpt-transcribe; gpt-transcribecon pistas pertinentes de prompt, keywords e idioma.
Mide más que la tasa de error de palabra agregada:
| Dimensión de evaluación | Qué comprobar |
|---|---|
| Completitud | Frases que faltan, finales truncados y habla de bajo volumen saltada |
| Entidades críticas | Coincidencia exacta de nombres, números, correos, medicamentos, SKUs e IDs de cuenta |
| Comportamiento de idioma | Escritura correcta, cambio de código, redacción traducida frente a original e idiomas detectados |
| Robustez | Acentos, música de fondo, reverberación, hablantes solapados y audio de telefonía |
| Disciplina de pistas | Si los keywords suministrados aparecen solo cuando se pronunciaron de verdad |
| Comportamiento de streaming | Tiempo hasta el primer delta, tiempo hasta el texto final, revisiones parciales y orden de eventos |
| Resiliencia operativa | Audio vacío, archivos dañados, reintentos, desconexiones y manejo de envíos duplicados |
No «mejores» una transcripción de evaluación con un modelo general de texto antes de puntuarla. El posprocesado puede crear un documento más legible y, en silencio, cambiar las palabras del hablante. Conserva una capa literal y deriva después una capa limpia o resumida con rastro de auditoría.
Lo que GPT Transcribe no sustituye
El valor por defecto más nuevo no es, automáticamente, el modelo más completo en funciones para cada salida.
Diarización de hablantes
Si el producto tiene que responder «quién dijo qué», usa gpt-4o-transcribe-diarize. Su respuesta diarized_json contiene segmentos con hablante y metadatos de inicio y fin. Para grabaciones de más de 30 segundos, OpenAI exige una estrategia de troceado automática o configurada. El modelo también puede aceptar muestras de referencia cortas para un número limitado de hablantes conocidos, pero el etiquetado de hablantes no está soportado en sesiones de transcripción Realtime.
Marcas de tiempo por palabra y subtítulos
La salida centrada en JSON de GPT Transcribe no sustituye de forma directa todos los formatos de respuesta de Whisper. Si un montador depende de marcas de tiempo a nivel de palabra, marcas de segmento, SRT, VTT o verbose_json, conserva whisper-1 o construye y valida una capa aparte de alineación y subtítulos. No fabriques códigos de tiempo repartiendo palabras de forma uniforme a lo largo de la duración del archivo.
Traducción
La transcripción conserva el idioma original hablado. La traducción cambia de idioma. La ruta de OpenAI para grabaciones terminadas hacia el inglés sigue siendo /v1/audio/translations con whisper-1. Para otros flujos de traducción, separa reconocimiento y traducción para que cada etapa se pueda revisar.
Longitud de entrada ilimitada
El límite de subida de 25 MB no es una promesa de duración. Una grabación mono comprimida puede caber muchos más minutos que un WAV estéreo sin comprimir. Para entradas más grandes, comprime con criterio o parte en límites semánticos. Cortar a mitad de una frase quita contexto acústico y lingüístico, y unos trozos solapados sin estrategia de reconciliación pueden duplicar palabras.
Coste y rendimiento
La página de precios de OpenAI listaba gpt-transcribe a $0.0045 per minute cuando se revisó este artículo. Eso es aproximadamente $0.27 por una hora de audio de origen, antes de almacenamiento, red, orquestación, reintentos, posprocesado y revisión humana.
El precio por minuto es solo una parte del coste de producción. Incluye:
- subidas fallidas o repetidas;
- normalización y troceado de medios;
- almacenamiento de archivos de origen y transcripciones aprobadas;
- gestión de terminología;
- revisión de calidad para contenido de alto impacto;
- resumen, búsqueda o tachado de datos sensibles a posteriori;
- residencia de datos o controles empresariales cuando apliquen.
Un modelo más barato puede salir caro si aumenta el tiempo de corrección. Un modelo más preciso puede seguir siendo la elección equivocada si el flujo exige subtítulos nativos o subtítulos continuos en directo. Compara el coste total del flujo contra el contrato de salida, no solo contra la fila del modelo.
Privacidad y manejo responsable
Las grabaciones suelen contener información más sensible que el texto ordinario: voces, pistas de identidad, conversaciones de fondo, direcciones, datos de salud y reuniones confidenciales. Obtén un derecho válido a grabar y procesar el audio, minimiza lo que recojas, protege el archivo de origen y fija un calendario de eliminación.
La documentación actual de controles de datos de la API de OpenAI afirma que los datos de la API no se usan para entrenar modelos salvo que el cliente se apunte de forma explícita. Su tabla de endpoints lista /v1/audio/transcriptions sin retención de estado de aplicación, sin retención de monitorización de abusos y con elegibilidad para Zero Data Retention. Son afirmaciones de plataforma, no un programa completo de privacidad. Tu cargador, el almacenamiento de objetos, los registros, la analítica, las herramientas de soporte y los procesadores posteriores tienen sus propias políticas y su propio comportamiento de retención.
Para trabajo regulado o de alto riesgo, confirma con los equipos legales y de seguridad responsables los requisitos contractuales, regionales, de seguridad y de revisión humana vigentes. Nunca trates una transcripción automática como el único registro de una decisión que podría afectar de forma material a una persona.
Una arquitectura de transcripción lista para producción

Una implementación fiable separa ingesta, transcripción, revisión y contenido derivado:
- Autoriza e ingiere. Valida a la persona usuaria, los derechos de grabación, el tipo de medio, el tamaño de archivo y los controles de malware.
- Normaliza el medio. Convierte contenedores no soportados, conserva una copia de origen cuando haga falta y evita recodificaciones con pérdida innecesarias.
- Adjunta contexto acotado. Elige solo los idiomas, keywords y la descripción de la grabación pertinentes a este trabajo.
- Transcribe de forma idempotente. Da a cada origen un ID de trabajo estable para que un reintento no cree trabajo facturable duplicado ni transcripciones en conflicto.
- Guarda el resultado en bruto. Conserva la respuesta exacta del modelo, el ID del modelo, los campos de contexto, la suma de comprobación del origen y la fecha de procesamiento.
- Revisa campos críticos. Pasa a una persona nombres, números, compromisos y lenguaje médico o legal de baja confianza o de alto impacto.
- Crea derivados. Genera resúmenes, capítulos, subtítulos, índices de búsqueda, versiones anonimizadas o elementos de acción a partir de la transcripción aprobada.
- Aplica retención. Elimina o archiva el audio de origen y los derivados según la política documentada.
La transcripción también puede ser la primera mitad de un flujo de audio bidireccional. Cuando la transcripción esté corregida, el equipo puede revisarla y usar texto a voz para crear narración accesible, borradores de localización o una locución aprobada. Etiqueta con claridad el origen reconocido y la salida generada: uno es evidencia de lo que se dijo; el otro es un medio recién sintetizado.
Integración de API frente a una herramienta de navegador
Usa la API cuando la transcripción forme parte de un producto, una automatización, un flujo de datos o un proceso interno repetible. Ofrece control sobre autenticación, contexto, seguimiento de trabajos, almacenamiento posterior y manejo de errores.
No toda evaluación necesita una integración primero. Un flujo de navegador sirve para probar unas pocas grabaciones representativas, entender las salidas esperadas o atender a una persona usuaria ocasional que necesita formatos de exportación más que código de SDK. El espacio de trabajo en línea de voz a texto de GPT Transcribe ofrece una ruta práctica de subida y revisión antes de que un equipo se comprometa a construir su propia interfaz.
El criterio de evaluación debería ser el mismo en cualquiera de las dos rutas: usa audio que estás autorizado a procesar, compara contra una referencia humana, inspecciona entidades críticas y entiende qué aplicación —no solo qué modelo subyacente— crea marcas de tiempo, etiquetas de hablante, exportaciones o almacenamiento.
¿Cuándo deberías elegir GPT Transcribe?
Elige gpt-transcribe cuando:
- la entrada es una grabación terminada o un turno confirmado y acotado;
- la salida deseada es texto preciso en el idioma original;
- la grabación puede cambiar entre idiomas esperados;
- el vocabulario de dominio puede beneficiarse de keywords acotados;
- los metadatos de idioma detectado son útiles;
- los eventos parciales de transcripción mejorarían la interfaz de procesamiento de archivos.
Elige una alternativa especializada cuando:
- el audio llega de forma continua y la baja latencia es esencial;
- hay que etiquetar a los hablantes;
- las marcas de tiempo a nivel de palabra o los archivos nativos de subtítulos son obligatorios;
- la salida tiene que ser una traducción al inglés;
- una integración existente depende de un formato de respuesta que
gpt-transcribeno ofrece.
La selección correcta se basa en el entregable que hace falta. «Una transcripción» puede significar texto plano, un objeto JSON que se pueda buscar, subtítulos sincronizados con vídeo, un registro de hablantes al estilo judicial o subtítulos en directo. Son productos distintos aunque todos empiecen por el reconocimiento del habla.
Preguntas frecuentes
¿GPT Transcribe es lo mismo que GPT-4o Transcribe?
No. gpt-transcribe es un ID de modelo actual distinto y el punto de partida que OpenAI recomienda para la transcripción ordinaria de archivos. Las integraciones existentes de gpt-4o-transcribe pueden seguir funcionando, pero no hay que asumir que sus campos de petición, precios y comportamiento de salida coincidan.
¿Puede GPT Transcribe transcribir un MP3 o un archivo de vídeo?
Sí. El endpoint de transcripción de archivos acepta contenedores habituales de audio y de medio. Verifica la lista actual de entradas y el límite de petición de 25 MB en la referencia de la API, sobre todo al validar FLAC, OGG o contenedores de vídeo.
¿GPT Transcribe identifica a hablantes distintos?
No por sí solo. Usa gpt-4o-transcribe-diarize y pide diarized_json cuando hagan falta segmentos etiquetados por hablante.
¿Puede crear subtítulos SRT o VTT?
No como una salida nativa de GPT Transcribe lista para usar. OpenAI dirige hoy los flujos de marcas de tiempo y SRT/VTT nativos a whisper-1, o puedes construir una capa de alineación probada por separado.
¿Puede GPT Transcribe procesar audio de micrófono en directo?
Para audio que llega de forma continua, usa el flujo de transcripción Realtime y empieza con gpt-live-transcribe. GPT Transcribe se puede usar para turnos confirmados a mano por WebSocket, que es distinto de unos subtítulos en directo ininterrumpidos.
¿Cómo mejoro la transcripción de nombres y términos técnicos?
Describe la grabación con prompt, aporta términos literales esperados mediante keywords y proporciona los languages esperados. Prueba que las pistas mejoren la recuperación sin insertar términos que nunca se pronunciaron.
¿GPT Transcribe es gratis?
La API de OpenAI se cobra por uso. En la fecha de revisión, el precio oficial listaba $0.0045 por minuto de audio para gpt-transcribe. Una interfaz de terceros puede ofrecer su propia prueba, créditos, límites o suscripción.
El valor por defecto útil, no la respuesta universal
GPT Transcribe da a los proyectos nuevos de voz a texto de OpenAI un valor por defecto sólido: un modelo para transcribir con precisión audio grabado, contexto multilingüe, detección de idioma y resultados de archivo en streaming. Su ventaja real no es que deje obsoletas todas las rutas anteriores. Da a quien desarrolla un camino general más claro y deja los trabajos especializados a modelos especializados.
Define primero la salida exigida. Después prueba gpt-transcribe con las grabaciones más ruidosas, más multilingües y más cargadas de terminología que vayan a enviar las personas usuarias. Una transcripción que supere esos casos —con contexto rastreable, revisión humana y límites claros— está lista para formar parte de un producto, no solo de una demostración llamativa.

