Muse Voice Transcribe explicado — o que a Meta lançou em 2026-09-01

Em 2026-09-07: a Meta Superintelligence Labs lançou o Muse Voice Transcribe em 2026-09-01, ASR em streaming em tempo real em blocos de 80 ms; o mesmo modelo cobre diarização de 20+ falantes e detecção de endpoint. A Meta afirma o primeiro lugar no ranking de speech-to-text em streaming da Artificial Analysis em 2026-09-01. Se você só precisa transformar um arquivo ou um link de aula em texto, use a ferramenta abaixo — não abra o console da Meta API.

Lançamento · 2026-09-01 ASR streaming 80 ms Teste abaixo

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.

Adicionar BibiGPT como fonte preferida no Google Veja mais BibiGPT nas Principais notícias e nas respostas com IA.

Fatos principais (90 segundos)

Em 2026-09-07: a Meta Superintelligence Labs lançou o Muse Voice Transcribe em 2026-09-01. É um modelo de percepção de áudio em tempo real: ASR em streaming de 80 ms, diarização 20+, detecção de endpoint, num único passe. A Meta afirma o primeiro lugar no speech-to-text em streaming da Artificial Analysis em 2026-09-01. A Meta Model API custa US$ 0,18 por hora de áudio. Última atualização: 2026-09-07.

Features

O que o Muse Voice Transcribe realmente é

É o modelo de percepção de áudio em tempo real hospedado pela Meta Superintelligence Labs, família Muse Spark. Não é o Muse Image. O ID do modelo na documentação da Meta é muse-voice-transcribe-1.0.

ASR em streaming de 80 ms (2026-09-01)

O áudio é cortado em blocos de 80 ms a 12,5 Hz. O modelo decide se continua ouvindo ou emite um fragmento de texto. A Meta chama isso de latência adaptativa: o aprendizado por reforço equilibra 「esperar mais um pouco」 e 「palavra mais precisa」.

Diarização e endpoint no mesmo passe

Os rótulos de falante cobrem mais de 20 pessoas. marcas de endpoint marcam o início e o fim da fala. A Meta diz que não precisa de um pós-processamento separado. A fonte é a página de pesquisa.

US$ 0,18 por hora de áudio, só API

A documentação de speech-to-text da Meta lista US$ 0,18 por hora de áudio (US$ 3 por 1000 minutos); streaming e upload de arquivo no mesmo preço. Não há pesos open source. A ditação de voz no Meta AI for Mac e no Muse Code já usa este modelo.

Se você processa áudio longo, o que isso muda

Uma API de ASR em tempo real ajuda times que montam assistentes de voz. Ela não substitui um produto que arquiva para humanos transcrição com timestamp, capítulos e perguntas de acompanhamento — muitas vezes basta colar um link.

Você não precisa abrir o console da Model API

Cole um link de aula ou podcast, ou solte um MP3. Você quer uma transcrição pesquisável, não o WebSocket wss://api.meta.ai/v1/asr/realtime.

A transcrição é a camada de interface, não o produto final

O texto em streaming ainda precisa ser lido. O BibiGPT recebe o mesmo arquivo ou link e devolve capítulos, transcrição com timestamp e notas que você pode perguntar.

É Voice Transcribe, não Muse Image

Muse Image é outro lançamento da Meta em 2026. Cada intenção tem a sua URL. Esta página cobre só o modelo de voz de 09-01.

5 mudanças-chave (90 segundos)

Fatos centrais do lançamento Muse Voice Transcribe da Meta em 2026-09-01.

  1. 1

    Lançamento 2026-09-01, só hospedado

    A Meta Superintelligence Labs publicou muse-voice-transcribe-1.0. Disponível pela Meta Model API, Meta AI for Mac e Muse Code. Não há pesos open source. No Mac, segure Fn para ditar pelo Meta AI.

  2. 2

    Blocos de 80 ms e latência adaptativa

    A cada 80 ms (12,5 Hz) o áudio vira um fragmento. O modelo escolhe continuar ouvindo ou emitir texto. A latência adaptativa é treinada com reforço: multiplica a recompensa de erro de palavra pela de latência; palavras difíceis esperam mais.

  3. 3

    Diarização e endpoint compartilham o passe de reconhecimento

    Marcas especiais marcam troca de falante, rótulos A–Z (20+ pessoas), onset e endpoint. A Meta afirma que áudio de mais de uma hora também não precisa de um fluxo extra de pós-processamento.

  4. 4

    Treino em 70+ idiomas, validação de 25

    No lançamento a Meta recomenda esses 25 idiomas bem validados; o resto também pode ser testado. Troca de código intra e interoracional é nativa. Viés de idioma, palavras-chave e contexto melhora nomes próprios e jargão.

  5. 5

    US$ 0,18 por hora mais um ranking de streaming independente

    A documentação da Meta indica US$ 0,18 por hora de áudio. A Meta afirma o primeiro lugar no speech-to-text em streaming e na diarização pública da Artificial Analysis em 2026-09-01. O VentureBeat cita o slide do lançamento: AA-WER Streaming 3,1% de erro de palavra no texto final.

3 cenários típicos de quem usa o BibiGPT

Onde uma API de ASR em tempo real importa — e qual é o trabalho real de um produto 「link vira nota」.

Você está montando um assistente de voz

Times que precisam de resultados parciais via WebSocket e detecção de limite de turno podem avaliar a Meta Model API. Depois mandam a gravação pronta para o BibiGPT, para a pessoa receber capítulos, não uma fila de eventos crus.

Você só quer transcrever a aula

Uma aula de 90 minutos não precisa de socket de ASR em tempo real. Cole a URL ou solte um M4A, exporte a transcrição com timestamp e continue perguntando. Esse é o caminho do produto.

Você acompanha os lançamentos de voz de 2026

Muse Voice Transcribe é o ASR em streaming da Meta de 09-01. Granite Speech 5.0 Turbo CTC são os pesos de throughput em inglês da IBM. Gemini 3.5 Transcribe saiu em 2026-08-26; live e arquivo são APIs diferentes. Cada família tem a sua URL; não monte uma página genérica de 「ASR 2026」.

Ferramentas BibiGPT relacionadas

Fluxos de transcrição e notas que acompanham este lançamento.

Fontes

Os fatos do lançamento vêm dos textos da própria Meta. Preço e slide do ranking de streaming de cobertura independente ficam marcados à parte.

  • Em 2026-09-01, a Meta Superintelligence Labs lançou o Muse Voice Transcribe como o primeiro modelo de percepção de áudio em tempo real da família Muse Spark: ASR em streaming de 80 ms, diarização 20+, detecção de endpoint, treino em 70+ idiomas (25 bem validados), troca de código nativa e suporte nativo a áudio de mais de uma hora. A Meta afirma o primeiro lugar no speech-to-text em streaming da Artificial Analysis em 2026-09-01.

    Meta AI Research — Introducing Muse Voice Transcribe ↗
  • A documentação de speech-to-text da Meta lista o modelo muse-voice-transcribe-1.0, WebSocket em tempo real e POST de arquivo, US$ 0,18 por hora de áudio, timestamps no nível do turno (não da palavra), 25 idiomas de avaliação e troca de código.

    Meta AI Developer — Speech to text ↗
  • O VentureBeat (2026-09) noticia o preço de US$ 0,18/hora e cita o slide de lançamento da Meta: AA-WER Streaming da Artificial Analysis 3,1% de erro de palavra no texto final, abaixo de outros sistemas em streaming no mesmo slide.

    VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗
  • Gemini 3.5 Transcribe (2026-08-26) é outro lançamento do Google: os números da Artificial Analysis citados pelo Google são WER em streaming 4,0%, WER fora de streaming 2,6%, 85+ idiomas. Live e arquivo são APIs diferentes. Data dos dados: 2026-08.

    Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗

Termos desta página

O que é ASR em streaming?

O reconhecimento automático de fala em streaming transforma som em texto enquanto o áudio ainda entra, sem esperar o fim do arquivo. fragmentos parciais aparecem primeiro e depois podem ser corrigidos. É um desenho de latência, não um nome de marca.

O que é diarização de falantes?

A diarização etiqueta 「quem falou quando」 na gravação. O sistema atribui marcas de falante aos turnos para a ata separar vozes. Cobrir 20+ pessoas só significa um conjunto de etiquetas grande, não reconhecer o nome de cada um.

O que é detecção de endpoint no ASR?

A detecção de endpoint marca o início e o fim de um turno para o assistente de voz saber quando parar de ouvir e começar a responder. É troca de turno, não pontuação. O modelo emite marcas de início e fim; não espera o botão de stop.

Adorado por criadores, estudantes e pesquisadores

Por que as pessoas usam o BibiGPT todos os dias para transformar vídeos em texto.

Mais de 50.000 usuários no mundo todo confiam

★★★★★

“Colo um link e recebo legendas limpas em segundos — economizo horas de redigitação toda semana.”

Maya R.

Criadora de conteúdo · Reaproveita vídeos curtos

★★★★★

“Exportar a transcrição me deixa revisar palavras novas no meu ritmo, sem pausar o vídeo o tempo todo.”

Daniel K.

Estudante de idiomas · Estuda com vídeos reais

★★★★★

“Texto preciso e com marcação de tempo que posso citar diretamente. Sem perceber, virou parte do meu fluxo diário.”

Priya S.

Pesquisadora · Cita palestras públicas

Perguntas frequentes

Tire qualquer dúvida.

Popular guides

Pule o aperto de mão da API e transcreva áudio aqui

Cole um link do YouTube, Bilibili ou podcast — ou solte MP3, WAV, M4A. O BibiGPT devolve transcrição com timestamp, resumo com IA e notas pesquisáveis. Última atualização: 2026-09-07.