Разбор Muse Voice Transcribe — что Meta выпустила 2026-09-01

На 2026-09-07: Meta Superintelligence Labs 1 сентября 2026 выпустила Muse Voice Transcribe — потоковое распознавание речи в реальном времени блоками по 80 мс; та же модель покрывает диаризацию 20+ говорящих и детект конца фразы. Meta заявляет первое место в рейтинге потокового speech-to-text Artificial Analysis на 2026-09-01. Если нужно просто превратить файл или ссылку на лекцию в текст, воспользуйтесь инструментом ниже — консоль Meta API открывать не нужно.

Релиз · 2026-09-01 Поток ASR 80 мс Демо ниже

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.

Добавьте BibiGPT в предпочитаемые источники Google Больше материалов BibiGPT в «Главных новостях» и ответах ИИ.

Главные факты (90 секунд)

На 2026-09-07: Meta Superintelligence Labs 1 сентября 2026 выпустила Muse Voice Transcribe. Это модель восприятия аудио в реальном времени: поток ASR 80 мс, диаризация 20+, детект конца фразы — за один проход. Meta заявляет первое место в потоковом speech-to-text Artificial Analysis на 2026-09-01. Meta Model API — 0,18 доллара за час аудио. Обновлено: 2026-09-07.

Features

Что такое Muse Voice Transcribe на самом деле

Это хостинговая модель восприятия аудио в реальном времени от Meta Superintelligence Labs, семейство Muse Spark. Это не Muse Image. ID модели в документации Meta — muse-voice-transcribe-1.0.

Потоковое распознавание с шагом 80 мс (2026-09-01)

Аудио режется блоками по 80 мс при 12,5 Гц. Модель сама решает, слушать дальше или выдать текстовый токен. Meta называет это адаптивной задержкой: обучение с подкреплением балансирует «подождать ещё» и «точнее слово».

Диаризация и детект конца фразы за один проход

Метки говорящих покрывают более 20 человек. Токены endpoint отмечают начало и конец речи. Meta утверждает, что отдельный постпроцессинг не нужен. Опора — страница исследования.

0,18 доллара за час аудио, только API

Документация speech-to-text Meta указывает 0,18 доллара за час аудио (3 доллара за 1000 минут), поток и загрузка файла по одной цене. Открытых весов нет. Диктовка в Meta AI for Mac и Muse Code уже использует эту модель.

Если вы обрабатываете длинное аудио

API распознавания речи в реальном времени помогает командам, которые строят голосовых ассистентов. Оно не заменяет продукт, который архивирует человеку расшифровку с таймкодами, главы и вопросы — часто достаточно вставить ссылку.

Консоль Model API не нужна

Вставьте ссылку на лекцию или подкаст либо перетащите MP3. Нужна поисковая расшифровка, а не сокет wss://api.meta.ai/v1/asr/realtime.

Расшифровка — слой интерфейса, не готовый продукт

Потоковый сырой текст всё равно надо читать. BibiGPT принимает тот же файл или ссылку и возвращает главы, расшифровку с таймкодами и заметки, по которым можно спрашивать.

Это Voice Transcribe, не Muse Image

Muse Image — другой релиз Meta 2026 года. У каждого намерения свой URL. Эта страница покрывает только голосовую модель от 09-01.

5 ключевых изменений (90 секунд)

Ядро фактов из релиза Muse Voice Transcribe от Meta 2026-09-01.

  1. 1

    Релиз 2026-09-01, только хостинг

    Meta Superintelligence Labs вывела muse-voice-transcribe-1.0. Доступны Meta Model API, Meta AI for Mac и Muse Code. Открытых весов нет. На Mac удерживайте Fn, чтобы диктовать через Meta AI.

  2. 2

    Блоки 80 мс и адаптивная задержка

    Каждые 80 мс (12,5 Гц) аудио становится токеном. Модель выбирает, слушать дальше или выдать текст. Адаптивная задержка обучается с подкреплением: награда за ошибку слова умножается на награду за задержку — сложные слова ждут дольше.

  3. 3

    Диаризация и endpoint делят проход распознавания

    Специальные токены отмечают смену говорящего, метки A–Z (20+ человек), onset и endpoint. Meta утверждает, что длинное аудио больше часа не требует отдельного пайплайна постпроцессинга.

  4. 4

    Обучение на 70+ языках, проверка 25

    На старте Meta советует эти 25 достаточно проверенных языков; остальные тоже можно пробовать. Переключение кодов внутри и между предложениями нативное. Смещение по языку, ключевым словам и контексту повышает точность имён и жаргона.

  5. 5

    0,18 доллара в час плюс независимый потоковый рейтинг

    Документация Meta указывает 0,18 доллара за час аудио. Meta заявляет первое место в потоковом speech-to-text и публичной диаризации Artificial Analysis на 2026-09-01. VentureBeat цитирует слайд релиза: AA-WER Streaming 3,1% на финальном тексте.

3 типичных сценария пользователя BibiGPT

Где важен API распознавания в реальном времени — и какая работа у продукта «ссылка в заметки».

Вы делаете голосового ассистента

Командам нужны частичные результаты по WebSocket и детект границ хода — можно оценить Meta Model API. Готовую запись затем отдайте в BibiGPT, чтобы человек получил главы, а не сырую ленту событий.

Нужно просто расшифровать лекцию

Девяностоминутной лекции не нужен сокет распознавания в реальном времени. Вставьте URL или перетащите M4A, экспортируйте расшифровку с таймкодами и продолжайте спрашивать. Это продуктовый путь.

Вы следите за релизами речи 2026 года

Muse Voice Transcribe — потоковое распознавание Meta от 09-01. Granite Speech 5.0 Turbo CTC — английские веса пропускной способности IBM. Gemini 3.5 Transcribe вышел 2026-08-26, live и файл — разные API. У каждого семейства свой URL; не склеивайте общую страницу «распознавание речи 2026».

Связанные инструменты BibiGPT

Рабочие процессы расшифровки и заметок рядом с этим релизом.

Источники

Факты релиза — из материалов самой Meta. Цена и слайд потокового рейтинга из независимой статьи отмечены отдельно.

  • 2026-09-01 Meta Superintelligence Labs выпустила Muse Voice Transcribe — первую модель восприятия аудио в реальном времени семейства Muse Spark: поток ASR 80 мс, диаризация 20+, детект конца фразы, обучение на 70+ языках (25 достаточно проверены), нативное переключение кодов, нативная поддержка аудио длиннее часа. Meta заявляет первое место в потоковом speech-to-text Artificial Analysis на 2026-09-01.

    Meta AI Research — Introducing Muse Voice Transcribe ↗
  • Документация speech-to-text Meta перечисляет модель muse-voice-transcribe-1.0, realtime WebSocket и POST файла, 0,18 доллара за час аудио, таймкоды на уровне хода (не слова), 25 оценочных языков и переключение кодов.

    Meta AI Developer — Speech to text ↗
  • VentureBeat (2026-09) сообщает цену 0,18 доллара/час и цитирует слайд релиза Meta: AA-WER Streaming Artificial Analysis 3,1% на финальном тексте — ниже других потоковых систем на том же слайде.

    VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗
  • Gemini 3.5 Transcribe (2026-08-26) — другой релиз Google: цифры Artificial Analysis, которые цитирует Google, — потоковый WER 4,0%, непотоковый WER 2,6%, 85+ языков. Live и файл — разные API. Дата данных — 2026-08.

    Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗

Термины на этой странице

Что такое потоковое распознавание речи?

Потоковое автоматическое распознавание речи превращает звук в текст, пока аудио ещё поступает, не дожидаясь конца файла. Сначала появляются частичные токены, потом их можно исправить. Это конструкция задержки, не бренд.

Что такое диаризация говорящих?

Диаризация помечает в записи «кто говорил и когда». Система назначает метки говорящих ходам, чтобы протокол встречи разделял голоса. «Более 20 человек» означает большой набор меток, а не распознавание каждого имени.

Что такое детект конца фразы в распознавании речи?

Детект конца фразы отмечает начало и конец реплики, чтобы голосовой ассистент знал, когда перестать слушать и начать отвечать. Это смена хода, не пунктуация. Модель выдаёт токены onset и endpoint, а не ждёт кнопку стоп.

Нравится авторам, студентам и исследователям

Почему люди каждый день используют BibiGPT, чтобы превращать видео в текст.

Нам доверяют более 50 000 пользователей по всему миру

★★★★★

“Вставляю ссылку — и через несколько секунд получаю чистые субтитры. Каждую неделю это экономит мне часы перепечатки.”

Maya R.

Контент-мейкер · Переупаковывает короткие видео

★★★★★

“Экспорт расшифровки позволяет повторять новые слова в своём темпе, не останавливая видео каждую минуту.”

Daniel K.

Изучает языки · Учится по реальным видео

★★★★★

“Точный текст с таймкодами, который можно цитировать напрямую. Незаметно стал частью моей ежедневной работы.”

Priya S.

Исследователь · Цитирует публичные выступления

Часто задаваемые вопросы

Спрашивайте что угодно.

Popular guides

Пропустите рукопожатие API — переведите речь в текст здесь

Вставьте ссылку YouTube, Bilibili или подкаста — или перетащите MP3, WAV, M4A. BibiGPT вернёт расшифровку с таймкодами, AI-саммари и поисковые заметки. Обновлено: 2026-09-07.