GPT Transcribe é o modelo de voz para texto recomendado pela OpenAI para transformar gravações concluídas em texto no idioma original. Ele foi projetado para arquivos de áudio enviados, resultados de transcrição transmitidos em streaming a partir de arquivos completos e turnos de áudio confirmados em sessões Realtime por WebSocket. Esse alcance o torna útil em reuniões, entrevistas, podcasts, chamadas de suporte, gravações de pesquisa e qualquer produto que precise extrair texto pesquisável da fala.
O detalhe importante é o nome exato do modelo: gpt-transcribe. Ele não é um atalho para gpt-4o-transcribe nem um modelo geral do ChatGPT que passou a aceitar MP3. A OpenAI o descreve como um modelo de transcrição especializado e de alta precisão, com entradas de áudio e texto, saída de texto, pistas de contexto, orientação multilíngue, detecção de idioma e suporte a streaming. Este guia explica o que essas capacidades significam na prática — e quando outro modelo ainda é a escolha correta.
Fontes e detalhes do produto revisados em 30 de julho de 2026. Verifique novamente a disponibilidade do modelo, os preços, os limites e os controles de dados antes de iniciar o tráfego de produção.
Ideias-chave
- Comece com
gpt-transcribepara uma gravação finalizada que deve permanecer no seu idioma original. - Envie os arquivos para
POST /v1/audio/transcriptions; a resposta contém o texto da transcrição e os idiomas que o modelo pode detectar com precisão. - Use
prompt,keywordselanguagescomo contexto relevante, não como instruções para criar conteúdo. - Transmitir a transcrição de um arquivo já completo em streaming não é o mesmo que transcrever um microfone ao vivo sem parar.
- Reserve rotas específicas para rótulos de locutor, marcações de tempo por palavra, arquivos de legendas e tradução para inglês.
- Avalie nomes, números, omissões, mudanças de idioma, latência e inserções falsas com seu próprio áudio antes de lançar.
O que é GPT Transcribe?
O GPT Transcribe é um modelo de reconhecimento automático de fala. Sua função principal é mais específica do que a de um modelo conversacional: ele recebe áudio falado, além de um contexto textual opcional, e retorna uma transcrição escrita. A ficha oficial do modelo GPT Transcribe lista áudio e texto como modalidades de entrada, texto como modalidade de saída e os endpoints de transcrição comum e Realtime como compatíveis.
O nome “GPT” é importante porque a interface pode usar contexto linguístico que um pipeline acústico tradicional trataria separadamente. Uma solicitação pode descrever a gravação, listar termos literais que provavelmente aparecerão e identificar vários idiomas esperados. No entanto, a OpenAI não publicou uma arquitetura detalhada nem um método de treinamento na documentação do modelo. Afirmar uma contagem interna de parâmetros, o tamanho do conjunto de dados, o design do decodificador ou uma precisão universal seria mera especulação.
A definição prática é mais útil:
GPT Transcribe é um modelo de voz para texto com contexto que transcreve arquivos e turnos de áudio confirmados com precisão, oferecendo saída focada em JSON e metadados dos idiomas detectados.
Essa definição também evita um erro comum relacionado a nomes. gpt-transcribe, gpt-4o-transcribe, gpt-4o-mini-transcribe, gpt-4o-transcribe-diarize, gpt-live-transcribe e whisper-1 são diferentes opções de modelo. Eles se sobrepõem, mas seus melhores fluxos e resultados suportados não são iguais.
Onde se encaixa na pilha de voz para texto da OpenAI
A documentação atual da OpenAI recomenda começar pelo modelo que corresponda ao ciclo de vida do áudio e aos requisitos de saída. A decisão não é apenas “modelo novo contra modelo antigo”.
| Requisito | Ponto de partida recomendado | Por quê |
|---|---|---|
| Gravação concluída no idioma original | gpt-transcribe | Transcrição geral do arquivo, pistas de contexto, idiomas detectados e texto em streaming |
| Áudio de microfone, chamada ou meio que chega sem parar | gpt-live-transcribe | Transcrição com baixa latência à medida que o áudio chega |
| Rótulos de locutor em uma gravação concluída | gpt-4o-transcribe-diarize | Retorna segmentos com locutor em diarized_json |
| Marcações de tempo por palavra ou por segmento | whisper-1 | Permite granularidade de marcagens de tempo com verbose_json |
| Saída nativa de legendas em SRT ou VTT | whisper-1 | Permite formatos de resposta de legendas de forma direta |
| Tradução da fala gravada para inglês | whisper-1 em /v1/audio/translations | Rota dedicada para áudio em inglês |
Essa distinção costuma passar despercebida porque “streaming” descreve duas coisas diferentes. Um arquivo já pode existir no disco enquanto a API envia eventos parciais de transcrição para o aplicativo. A transcrição ao vivo é outra situação: o áudio do microfone ou da chamada continua chegando, e o sistema precisa gerenciar uma sessão em tempo real. O guia de migração do Whisper para GPT da OpenAI recomenda explicitamente tratar o áudio ao vivo e a saída em streaming como decisões separadas.
Para uma descrição breve e voltada ao navegador sobre o modelo e seus limites práticos, a visão geral do modelo GPT Transcribe é um complemento útil à documentação da API.
Como funciona o /v1/audio/transcriptions
Para um arquivo finalizado, a integração continua sendo deliberadamente simples. O aplicativo abre o arquivo de áudio, o envia como dados multipart, seleciona gpt-transcribe e recebe JSON.
curl --request POST \
--url https://api.openai.com/v1/audio/transcriptions \
--header "Authorization: Bearer $OPENAI_API_KEY" \
--header "Content-Type: multipart/form-data" \
--form file=@/path/to/meeting.mp3 \
--form model=gpt-transcribeUma resposta correta pode incluir tanto o texto quanto os idiomas detectados:
{
"text": "Bonjour, can everyone see the AC-42 billing record?",
"languages": [{ "code": "fr" }, { "code": "en" }]
}A detecção de idioma é um metadado probabilístico, e não um reflexo obrigatório das informações enviadas pelo cliente. Um array languages vazio é válido quando o modelo não consegue fazer uma previsão confiável; por si só, não significa que o áudio estava em silêncio nem que a solicitação falhou.
O guia de voz para texto da OpenAI atualmente limita cada upload na API de Transcrições a 25 MB e resume a compatibilidade com MP3, MP4, MPEG, MPGA, M4A, WAV e WebM. A referência atual do endpoint também inclui FLAC e OGG. Como o resumo do guia e o esquema do endpoint podem evoluir em momentos diferentes, consulte a referência da API Create transcription ao implementar a validação, em vez de transformar uma lista estática de formatos em uma promessa permanente do produto.
O contexto é a superfície de controle mais importante do modelo
As gravações reais estão cheias de palavras fáceis de ouvir errado e caras de errar: identificadores de clientes, nomes de medicamentos, números de modelo, pessoas, organizações, siglas e frases em vários idiomas. O GPT Transcribe separa três tipos de contexto.
prompt: descreva a gravação
Um prompt é um contexto livre sobre o ambiente ou o tópico. Um prompt útil poderia ser:
A customer support call about enterprise billing and an account migration.
Preserve filler words because the transcript will be used for conversation research.Isso informa ao modelo em qual contexto linguístico ele está operando. Também pode indicar preferências de formato ou trazer o contexto do trecho anterior de uma gravação longa. Não deve conter uma transcrição inventada nem pedir ao modelo que resuma; transcrever e processar posteriormente são tarefas diferentes.
keywords: adicione termos literais
As palavras-chave são palavras ou frases que podem realmente aparecer na gravação:
["AC-42", "Premium Plus", "ZyntriQix", "SOC 2"]São pistas, não uma saída obrigatória. Essa distinção é importante para o funcionamento do sistema. Uma lista de terminologia pode melhorar o reconhecimento, mas uma lista irrelevante ou excessiva pode induzir o modelo a reconhecer uma palavra que ninguém pronunciou. A OpenAI recomenda avaliar explicitamente a alucinação de palavras-chave: a transcrição só deve conter um termo quando o áudio o sustentar.
languages: identifique os idiomas esperados
O array languages pode descrever áudio multilíngue e alternância entre idiomas. A documentação atual aceita códigos ISO 639-1 como en, es e fr, alguns códigos ISO 639-3 e códigos regionais de chinês como zh-cn, zh-tw e zh-hk.
Além de ser um recurso, esse é um detalhe de migração. O gpt-transcribe usa o campo no plural languages. Modelos mais antigos podem usar o campo no singular language. Não envie os dois supondo que o servidor escolherá um deles; a documentação atual indica que a API rejeita valores incompatíveis ou mal formatados.

Transmitir um arquivo concluído não é transcrição ao vivo
Use stream=true quando o arquivo de áudio já estiver completo, mas a interface precisar exibir texto à medida que o processamento avança. O GPT Transcribe emite eventos transcript.text.delta e termina com transcript.text.done.
Isso pode melhorar a percepção de velocidade durante uma entrevista longa. O usuário pode visualizar os primeiros parágrafos antes que o resultado completo esteja pronto, enquanto o aplicativo ainda recebe um evento final claro para salvar, indexar ou acionar etapas posteriores.
Não converte /v1/audio/transcriptions em um microfone aberto. Todo o arquivo é entregue junto com a solicitação. Para uma fonte em andamento, a OpenAI orienta os desenvolvedores para a transcrição Realtime e recomenda gpt-live-transcribe para trabalhos contínuos com baixa latência.
Existe um caminho intermediário avançado: gpt-transcribe pode operar em uma sessão de transcrição Realtime via WebSocket depois que o aplicativo confirmar manualmente um turno de áudio. Isso é útil quando a precisão após um enunciado específico importa mais do que legendas contínuas. O aplicativo adiciona o áudio, confirma o buffer e recebe os deltas, seguidos por um evento de transcrição concluída para aquele turno.
Isso oferece às equipes de produto três padrões diferentes de interação:
- Transcrição de arquivo bloqueante: envie uma gravação concluída e aguarde o JSON final.
- Resultado do arquivo em streaming: envie uma gravação concluída e exiba os deltas da transcrição.
- Transcrição em tempo real: envie áudio através de uma conexão em andamento, de forma contínua com um modelo em tempo real ou em turnos confirmados manualmente.
Nomear corretamente esses padrões evita surpresas de arquitetura no futuro.
O que significa precisão na produção
Não existe um número honesto e universal de precisão para a conversão de voz para texto. A taxa de erro de palavras varia conforme o idioma, o sotaque, a distância do microfone, o codec, o ruído, a sobreposição, o vocabulário, o comportamento do locutor e as regras de pontuação ou uso de maiúsculas na normalização. Um conjunto de testes com narração limpa em inglês não prevê o desempenho de uma chamada de suporte bilíngue gravada em um canal telefônico de 8 kHz.
O GPT Transcribe deve ser avaliado como componente de um fluxo específico, e não como um rótulo de classificação. Crie um conjunto de avaliação pequeno e autorizado que represente o áudio real que os usuários enviarão. Mantenha uma transcrição de referência aprovada por uma pessoa e compare pelo menos três configurações:
- a linha de base de produção atual;
- uma mudança apenas de modelo para
gpt-transcribe; gpt-transcribecom pistas relevantes de prompt, palavras-chave e idioma.
Meça mais do que a taxa agregada de erro de palavras:
| Dimensão de avaliação | O que verificar |
|---|---|
| Completude | Frases faltantes, finalizações truncadas e diálogos com volume baixo cortados |
| Entidades críticas | Correspondência exata de nomes, números, e-mails, medicamentos, SKUs e IDs de conta |
| Comportamento do idioma | Escrita correta, alteração de código, redação traduzida em comparação com o original e idiomas detectados |
| Robustez | Acentos, música de fundo, reverberação, locutores sobrepostos e áudio de telefonia |
| Disciplina das pistas | Se as palavras-chave fornecidas aparecem apenas quando são pronunciadas de verdade |
| Comportamento do streaming | Tempo até o primeiro delta, tempo até o texto final, revisões parciais e ordem dos eventos |
| Resiliência operacional | Áudio vazio, arquivos danificados, tentativas novas, desconexões e gestão de envios duplicados |
Não “melhore” uma transcrição de avaliação com um modelo geral de texto antes de pontuá-la. O processamento posterior pode criar um documento mais legível e, silenciosamente, alterar as palavras do locutor. Mantenha uma camada literal e, depois, derive uma camada limpa ou resumida com trilha de auditoria.
O que o GPT Transcribe não substitui
O novo valor padrão não é, automaticamente, o modelo mais completo com todas as funções para cada saída.
Identificação de locutores
Se o produto precisar responder à pergunta “quem disse o quê”, use gpt-4o-transcribe-diarize. Sua resposta diarized_json contém segmentos com o locutor e metadados de início e fim. Para gravações de mais de 30 segundos, a OpenAI exige uma estratégia de segmentação automática ou configurada. O modelo também pode aceitar amostras de referência curtas para um número limitado de locutores conhecidos, mas os rótulos de locutor não são compatíveis com sessões de transcrição em tempo real.
Marcas de tempo por palavra e subtítulos
A saída em JSON do GPT Transcribe não substitui diretamente todos os formatos de resposta do Whisper. Se um editor depende de marcações de tempo por palavra, marcações por segmento, SRT, VTT ou verbose_json, mantenha o whisper-1 ou crie e valide uma camada separada de alinhamento e legendagem. Não crie códigos de tempo distribuindo palavras de forma uniforme ao longo da duração do arquivo.
Tradução
A transcrição mantém o idioma original falado. A tradução muda o idioma. A rota da OpenAI para traduzir gravações concluídas para o inglês continua sendo /v1/audio/translations com whisper-1. Em outros fluxos de tradução, separe reconhecimento e tradução para que cada etapa possa ser revisada.
Comprimento de entrada ilimitado
O limite de upload de 25 MB não corresponde a uma duração fixa. Uma gravação mono comprimida pode conter muito mais minutos do que um WAV estéreo sem compressão. Para entradas maiores, comprima com critério ou divida o áudio em limites semânticos. Cortar uma frase pela metade elimina contexto acústico e linguístico, enquanto trechos sobrepostos sem uma estratégia de reconciliação podem duplicar palavras.
Custo e desempenho
A página de preços da OpenAI listava o gpt-transcribe em $0.0045 por minuto quando analisamos este artigo. Isso equivale a aproximadamente $0.27 por uma hora de áudio de origem, antes do armazenamento, rede, orquestração, tentativas extras, processamento posterior e revisão humana.
O preço por minuto é apenas uma parte do custo de produção. Inclui:
- uploads com falha ou repetidos;
- normalização e segmentação de mídias;
- armazenamento de arquivos de origem e transcrições aprovadas;
- gestão da terminologia;
- revisão de qualidade para conteúdo de alto impacto;
- resumo, busca ou exclusão posterior de dados sensíveis;
- residência de dados ou controles corporativos quando aplicados.
Um modelo mais barato pode se tornar caro se aumentar o tempo de correção. Um modelo mais preciso pode ainda ser a escolha errada se o fluxo exigir legendas nativas ou legendas contínuas ao vivo. Compare o custo total do fluxo com o contrato de entrega, e não apenas com a linha do modelo.
Privacidade e gestão responsável
Gravações geralmente contêm informações mais sensíveis do que o texto comum: vozes, pistas de identidade, conversas em segundo plano, endereços, dados de saúde e reuniões confidenciais. Obtenha um direito válido de gravar e processar o áudio, minimize o que coletar, proteja o arquivo original e defina um cronograma de eliminação.
A documentação atual sobre controles de dados da API da OpenAI afirma que os dados da API não são usados para treinar modelos, salvo quando o cliente opta explicitamente por isso. A tabela de endpoints lista /v1/audio/transcriptions sem retenção de estado do aplicativo, sem retenção para monitoramento de abusos e com opção de Zero Data Retention. Essas são características da plataforma, não um programa completo de privacidade. O componente de upload, o armazenamento de objetos, os logs, as ferramentas de análise e suporte e os processadores subsequentes têm políticas e comportamentos de retenção próprios.
Para trabalhos regulados ou de alto risco, confirme com as equipes legais e de segurança responsáveis os requisitos contratuais, regionais, de segurança e de revisão humana em vigor. Nunca trate uma transcrição automática como o único registro de uma decisão que possa afetar de forma material uma pessoa.
Uma arquitetura de transcrição pronta para produção

Uma implementação confiável separa ingestão, transcrição, revisão e conteúdo derivado:
- Autorize e aceite. Verifique a pessoa usuária, os direitos de gravação, o tipo de mídia, o tamanho do arquivo e os controles contra malware.
- Normalize a mídia. Converta contêineres incompatíveis, mantenha uma cópia original quando necessário e evite recodificações com perda desnecessária.
- Inclua contexto específico. Selecione apenas os idiomas, as palavras-chave e a descrição da gravação relevantes para esse trabalho.
- Transcreva de forma idempotente. Atribua a cada origem um ID de trabalho estável para que uma nova tentativa não crie trabalho duplicado nem transcrições conflitantes.
- Armazene o resultado bruto. Mantenha a resposta exata do modelo, o ID do modelo, os campos de contexto, a soma de verificação da origem e a data de processamento.
- Verifique campos críticos. Analise nomes, números, compromissos e linguagem médica ou jurídica de baixo ou alto impacto.
- Crie derivados. Gere resumos, capítulos, legendas, índices de busca, versões anonimizadas ou itens de ação a partir da transcrição aprovada.
- Aplique a retenção. Exclua ou arquive o áudio original e os derivados de acordo com a política documentada.
A transcrição também pode ser a primeira metade de um fluxo de áudio bidirecional. Quando a transcrição estiver corrigida, a equipe pode revisá-la e usar texto para fala para criar narrações acessíveis, rascunhos de localização ou uma locução aprovada. Marque claramente a origem reconhecida e a saída gerada: uma é evidência do que foi dito; a outra é um meio recém-sintetizado.
Integração da API com uma ferramenta de navegador
Use a API quando a transcrição fizer parte de um produto, de uma automação, de um fluxo de dados ou de um processo interno repetível. Ela oferece controle sobre autenticação, contexto, acompanhamento de tarefas, armazenamento posterior e gerenciamento de erros.
Nem toda avaliação requer uma integração inicial. Um fluxo de navegador serve para testar algumas gravações representativas, entender os resultados esperados ou atender a um usuário ocasional que precisa de formatos de exportação, e não de código de SDK. O ambiente de trabalho online de voz para texto do GPT Transcribe oferece um caminho prático para upload e revisão antes que a equipe se comprometa a criar sua própria interface.
O critério de avaliação deve ser o mesmo nas duas rotas: use áudio que você tenha autorização para processar, compare o resultado com uma referência humana, inspecione entidades críticas e entenda qual aplicativo — não apenas qual modelo subjacente — cria marcações de tempo, rótulos de locutor, exportações ou armazenamento.
Quando você deve escolher GPT Transcribe?
Escolha gpt-transcribe quando:
- A entrada é uma gravação concluída ou um turno confirmado e bem definido;
- A saída desejada é texto preciso no idioma original;
- A gravação pode mudar entre os idiomas esperados;
- O vocabulário do domínio pode se beneficiar de palavras-chave bem definidas;
- Os metadados do idioma detectado são úteis;
- Os eventos parciais de transcrição melhorariam a interface de processamento de arquivos.
Escolha uma alternativa especializada quando:
- o áudio chega de forma contínua e a baixa latência é essencial;
- é necessário rotular os locutores;
- as marcações de tempo em nível de palavra ou os arquivos nativos de legendas são obrigatórios;
- a saída deve ser uma tradução para inglês;
- uma integração existente depende de um formato de resposta que o
gpt-transcribenão oferece.
A escolha correta depende do produto final necessário. “Uma transcrição” pode significar texto plano, um arquivo JSON que possa ser pesquisado, legendas sincronizadas com o vídeo, um registro de locutores no estilo judicial ou legendas ao vivo. São produtos diferentes, mas todos começam com o reconhecimento da fala.
Perguntas frequentes
GPT Transcribe é a mesma coisa que GPT-4o Transcribe?
Não. gpt-transcribe é um ID de modelo atual diferente e o ponto de partida recomendado pela OpenAI para a transcrição comum de arquivos. As integrações existentes de gpt-4o-transcribe ainda podem funcionar, mas não se deve assumir que seus campos de solicitação, preços e comportamento de saída serão os mesmos.
O GPT Transcribe pode transcrever um MP3 ou um arquivo de vídeo?
Sim. O endpoint de transcrição aceita contêineres comuns de áudio e mídia. Verifique a lista atual de entradas e o limite de 25 MB por solicitação na referência da API, especialmente ao validar FLAC, OGG ou contêineres de vídeo.
O GPT Transcribe reconhece diferentes falantes?
Não por si só. Use gpt-4o-transcribe-diarize e solicite diarized_json quando precisar de segmentos identificados por locutor.
Você pode criar subtítulos em SRT ou VTT?
Não como saída nativa pronta para uso. Hoje, a OpenAI direciona os fluxos que exigem marcações de tempo e SRT/VTT nativos para whisper-1; outra opção é criar e testar uma camada de alinhamento separada.
O GPT Transcribe consegue processar áudio em tempo real do microfone?
Para áudio que chega continuamente, use o fluxo de transcrição em tempo real e comece com gpt-live-transcribe. O GPT Transcribe pode ser usado para turnos confirmados manualmente via WebSocket, o que é diferente de gerar legendas ao vivo contínuas.
Como melhorar a transcrição de nomes e termos técnicos?
Descreva o registro usando prompt, adicione os termos literais esperados por meio de keywords e forneça os languages solicitados. Teste para verificar se as pistas melhoram a recuperação, sem inserir termos que nunca foram pronunciados.
O GPT Transcribe é gratuito?
A API da OpenAI é cobrada por uso. Na data desta revisão, o preço oficial era de $0.0045 por minuto de áudio para gpt-transcribe. Uma interface de terceiros pode oferecer seu próprio período de teste, créditos, limites ou assinatura.
Um ponto de partida útil, não uma resposta universal
O GPT Transcribe oferece um ponto de partida sólido para novos projetos de conversão de voz para texto da OpenAI: um modelo capaz de transcrever áudio gravado com precisão, aproveitar contexto multilíngue, detectar idiomas e transmitir resultados em streaming. Seu verdadeiro benefício não está em tornar todas as rotas anteriores obsoletas. Ele oferece aos desenvolvedores um caminho geral mais claro e deixa tarefas específicas para modelos especializados.
Defina primeiro o formato de saída desejado. Depois, faça seu próprio teste do gpt-transcribe com as gravações mais ruidosas, multilíngues e cheias de termos técnicos que as pessoas usuárias enviarão. Uma transcrição que supere esses casos — com contexto rastreável, revisão humana e limites claros — está pronta para fazer parte de um produto, não apenas de uma demonstração chamativa.

