Muse Voice Transcribe explicado — qué lanzó Meta el 2026-09-01

Al 2026-09-07: Meta Superintelligence Labs lanzó Muse Voice Transcribe el 2026-09-01, ASR en streaming en tiempo real en bloques de 80 ms; el mismo modelo cubre diarización de 20+ hablantes y detección de endpoints. Meta afirma el primer lugar en el ranking de speech-to-text en streaming de Artificial Analysis al 2026-09-01. Si solo quieres pasar un archivo o un enlace de clase a texto, usa la herramienta de abajo: no abras la consola de Meta API.

Lanzamiento · 2026-09-01 ASR streaming 80 ms Prueba abajo

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.

Añade BibiGPT como fuente preferida en Google Verás más BibiGPT en Noticias destacadas y en las respuestas con IA.

Hechos clave (90 segundos)

Al 2026-09-07: Meta Superintelligence Labs lanzó Muse Voice Transcribe el 2026-09-01. Es un modelo de percepción de audio en tiempo real: ASR en streaming de 80 ms, diarización 20+, detección de endpoints, en un paso. Meta afirma el primer lugar en speech-to-text en streaming de Artificial Analysis al 2026-09-01. Meta Model API cuesta 0,18 USD por hora de audio. Última actualización: 2026-09-07.

Features

Qué es Muse Voice Transcribe de verdad

Es el modelo de percepción de audio en tiempo real alojado por Meta Superintelligence Labs, familia Muse Spark. No es Muse Image. El ID del modelo en la documentación de Meta es muse-voice-transcribe-1.0.

ASR en streaming de 80 ms (2026-09-01)

El audio se parte en bloques de 80 ms a 12,5 Hz. El modelo decide si seguir escuchando o emitir un fragmento de texto. Meta lo llama latencia adaptativa: el aprendizaje por refuerzo equilibra 「esperar un poco más」 y 「palabra más precisa」.

Diarización y endpoints en el mismo paso

Las etiquetas de hablante cubren más de 20 personas. Las marcas de endpoint marcan el inicio y el fin del habla. Meta dice que no hace falta un posprocesado aparte. La fuente es la página de investigación.

0,18 USD por hora de audio, solo API

La documentación de speech-to-text de Meta indica 0,18 USD por hora de audio (3 USD por 1000 minutos); streaming y subida de archivo al mismo precio. No hay pesos open source. El dictado de voz en Meta AI for Mac y Muse Code ya usa este modelo.

Si procesas audio largo, qué implica

Una API de ASR en tiempo real ayuda a equipos que construyen asistentes de voz. No sustituye un producto que archiva para humanos transcripciones con marcas de tiempo, capítulos y preguntas de seguimiento: a menudo basta con pegar un enlace.

No necesitas abrir la consola de Model API

Pega un enlace de clase o podcast, o suelta un MP3. Quieres una transcripción buscable, no el WebSocket wss://api.meta.ai/v1/asr/realtime.

La transcripción es la capa de interfaz, no el producto final

El texto en streaming todavía hay que leerlo. BibiGPT toma el mismo archivo o enlace y devuelve capítulos, transcripción con marcas de tiempo y notas que puedes preguntar.

Es Voice Transcribe, no Muse Image

Muse Image es otro lanzamiento de Meta en 2026. Cada intención tiene su URL. Esta página solo cubre el modelo de voz del 09-01.

5 cambios clave (90 segundos)

Hechos centrales del lanzamiento Muse Voice Transcribe de Meta el 2026-09-01.

  1. 1

    Lanzamiento 2026-09-01, solo alojado

    Meta Superintelligence Labs publicó muse-voice-transcribe-1.0. Disponible por Meta Model API, Meta AI for Mac y Muse Code. No hay pesos open source. En Mac, mantén Fn para dictar con Meta AI.

  2. 2

    Bloques de 80 ms y latencia adaptativa

    Cada 80 ms (12,5 Hz) el audio se vuelve un fragmento. El modelo elige seguir escuchando o emitir texto. La latencia adaptativa se entrena con refuerzo: multiplica la recompensa de error de palabra por la de latencia; las palabras difíciles esperan más.

  3. 3

    Diarización y endpoints comparten el paso de reconocimiento

    Marcas especiales marcan cambio de hablante, etiquetas A–Z (20+ personas), onset y endpoint. Meta afirma que el audio de más de una hora tampoco necesita un flujo extra de posprocesado.

  4. 4

    Entrenamiento en 70+ idiomas, validación de 25

    Al inicio Meta recomienda esos 25 idiomas bien validados; el resto también se puede probar. El cambio de código intra e interoración es nativo. El sesgo de idioma, palabras clave y contexto mejora nombres propios y jerga.

  5. 5

    0,18 USD por hora más un ranking de streaming independiente

    La documentación de Meta indica 0,18 USD por hora de audio. Meta afirma el primer lugar en speech-to-text en streaming y diarización pública de Artificial Analysis al 2026-09-01. VentureBeat cita la diapositiva del lanzamiento: AA-WER Streaming 3,1% de error de palabra en el texto final.

3 escenarios típicos de quien usa BibiGPT

Dónde importa una API de ASR en tiempo real — y cuál es el trabajo real de un producto 「enlace a notas」.

Estás construyendo un asistente de voz

Los equipos que necesitan resultados parciales por WebSocket y detección de límites de turno pueden evaluar Meta Model API. Luego pasan la grabación lista a BibiGPT para que la persona reciba capítulos, no una tira de eventos crudos.

Solo quieres pasar la clase a texto

Una clase de 90 minutos no necesita un socket de ASR en tiempo real. Pega la URL o suelta un M4A, exporta la transcripción con marcas de tiempo y sigue preguntando. Ese es el camino de producto.

Sigues los lanzamientos de voz de 2026

Muse Voice Transcribe es el ASR en streaming de Meta del 09-01. Granite Speech 5.0 Turbo CTC son los pesos de throughput en inglés de IBM. Gemini 3.5 Transcribe salió el 2026-08-26; live y archivo son APIs distintas. Cada familia tiene su URL; no armes una página genérica de 「ASR 2026」.

Herramientas BibiGPT relacionadas

Flujos de transcripción y notas que acompañan este lanzamiento.

Fuentes

Los hechos del lanzamiento salen de textos de Meta. Precio y diapositiva del ranking de streaming de cobertura independiente se marcan aparte.

  • El 2026-09-01, Meta Superintelligence Labs lanzó Muse Voice Transcribe como el primer modelo de percepción de audio en tiempo real de la familia Muse Spark: ASR en streaming de 80 ms, diarización 20+, detección de endpoints, entrenamiento en 70+ idiomas (25 bien validados), cambio de código nativo y soporte nativo de audio de más de una hora. Meta afirma el primer lugar en speech-to-text en streaming de Artificial Analysis al 2026-09-01.

    Meta AI Research — Introducing Muse Voice Transcribe ↗
  • La documentación de speech-to-text de Meta lista el modelo muse-voice-transcribe-1.0, WebSocket en tiempo real y POST de archivo, 0,18 USD por hora de audio, marcas de tiempo a nivel de turno (no de palabra), 25 idiomas de evaluación y cambio de código.

    Meta AI Developer — Speech to text ↗
  • VentureBeat (2026-09) informa el precio de 0,18 USD/hora y cita la diapositiva de lanzamiento de Meta: AA-WER Streaming de Artificial Analysis 3,1% de error de palabra en el texto final, por debajo de otros sistemas en streaming de la misma diapositiva.

    VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗
  • Gemini 3.5 Transcribe (2026-08-26) es otro lanzamiento de Google: las cifras de Artificial Analysis que cita Google son WER en streaming 4,0%, WER fuera de streaming 2,6%, 85+ idiomas. Live y archivo son APIs distintas. Fecha de los datos: 2026-08.

    Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗

Términos de esta página

¿Qué es el ASR en streaming?

El reconocimiento automático de voz en streaming convierte sonido en texto mientras el audio sigue entrando, sin esperar el final del archivo. Primero salen fragmentos parciales y luego se pueden corregir. Es un diseño de latencia, no un nombre de marca.

¿Qué es la diarización de hablantes?

La diarización etiqueta 「quién habló cuándo」 en una grabación. El sistema asigna marcas de hablante a los turnos para que el acta separe voces. Cubrir 20+ personas solo significa un conjunto de etiquetas grande, no reconocer el nombre de cada uno.

¿Qué es la detección de endpoints en ASR?

La detección de endpoints marca el inicio y el fin de un turno para que el asistente de voz sepa cuándo dejar de escuchar y empezar a responder. Es cambio de turno, no puntuación. El modelo emite marcas de inicio y fin; no espera el botón de stop.

Preferido por creadores, estudiantes e investigadores

Por qué la gente usa BibiGPT cada día para convertir vídeos en texto.

Más de 50 000 usuarios en todo el mundo confían en nosotros

★★★★★

“Pego un enlace y obtengo subtítulos limpios en segundos: me ahorra horas de transcripción cada semana.”

Maya R.

Creadora de contenido · Reutiliza vídeos cortos

★★★★★

“Exportar la transcripción me permite repasar vocabulario a mi ritmo en lugar de pausar el vídeo constantemente.”

Daniel K.

Estudiante de idiomas · Estudia con vídeos reales

★★★★★

“Texto preciso con marcas de tiempo que puedo citar directamente. Sin darme cuenta, ya es parte de mi rutina diaria.”

Priya S.

Investigadora · Cita charlas públicas

Preguntas frecuentes

Resolvemos cualquier duda.

Popular guides

Salta el apretón de manos de la API y transcribe audio aquí

Pega un enlace de YouTube, Bilibili o podcast — o suelta MP3, WAV, M4A. BibiGPT devuelve transcripción con marcas de tiempo, resumen con IA y notas buscables. Última actualización: 2026-09-07.