Muse Voice Transcribe 解读——2026-09-01 Meta 上线了什么

截至 2026-09-07:Meta Superintelligence Labs 于 2026-09-01 发布 Muse Voice Transcribe,以 80ms 分块做实时流式语音识别,同一模型覆盖 20+ 说话人分离和端点检测。Meta 称截至 2026-09-01 在 Artificial Analysis 流式语音转写榜上排名第一。若你只想把文件或讲座链接转成文字,用下面的工具即可,不必打开 Meta API 控制台。

发布 · 2026-09-01 80ms 流式语音识别 下方可试用

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.

把 BibiGPT 设为 Google 优先来源 在热门报道和 AI 概览里看到更多 BibiGPT。

关键事实(90 秒读完)

截至 2026-09-07:Meta Superintelligence Labs 于 2026-09-01 发布 Muse Voice Transcribe。这是实时音频感知模型:80ms 流式语音识别、20+ 说话人分离、端点检测,一遍完成。Meta 称截至 2026-09-01 在 Artificial Analysis 流式语音转写榜排名第一。Meta Model API 标价每小时音频 0.18 美元。最近更新:2026-09-07。

Features

Muse Voice Transcribe 实际是什么

这是 Meta Superintelligence Labs 的托管实时音频感知模型,属于 Muse Spark 家族。它不是 Muse Image。Meta 文档里的模型 ID 是 muse-voice-transcribe-1.0。

80ms 流式语音识别(2026-09-01)

音频按 80ms、12.5 Hz 分块。模型自己决定是继续听还是吐出一个文字片段。Meta 称之为自适应延迟:用强化学习在「多等一会儿」和「词更准」之间做权衡。

说话人分离和端点检测走同一遍

说话人标签覆盖 20 人以上。端点标记语音起止。Meta 称不需要单独的后处理步骤。这些说法以研究页为准。

每小时音频 0.18 美元,仅 API

Meta 语音转文字文档列出:处理一小时音频 0.18 美元(每 1000 分钟 3 美元),流式和文件上传同价。没有开源权重。Mac 上 Meta AI 和 Muse Code 的语音听写已经在用这个模型。

如果你要处理长音频,这意味着什么

实时语音识别 API 帮的是在做语音助手的团队。它替代不了给人类归档带时间戳的文字稿、章节和追问的产品——后者往往只需要粘一条链接。

你不必打开 Model API 控制台

粘贴讲座或播客链接,或拖入 MP3。要的是能搜索的文字稿,不是去握 wss://api.meta.ai/v1/asr/realtime 这根 WebSocket。

文字稿是接口,不是成品

流式原文仍要人读。BibiGPT 吃同一份文件或链接,返回章节、带时间戳的文字稿,以及可以追问的笔记。

这是 Voice Transcribe,不是 Muse Image

Muse Image 是 Meta 另一次 2026 发布。每种意图各留一个 URL。本页只覆盖 09-01 的语音模型。

5 条关键变化(90 秒读完)

来自 Meta 2026-09-01 Muse Voice Transcribe 发布的核心事实。

  1. 1

    2026-09-01 发布,仅托管

    Meta Superintelligence Labs 以 muse-voice-transcribe-1.0 上线。可通过 Meta Model API、Mac 版 Meta AI 和 Muse Code 使用。没有开源权重。在 Mac 上按住 Fn,即可通过 Meta AI 听写。

  2. 2

    80ms 分块与自适应延迟

    音频每 80ms(12.5 Hz)变成一个文字单元。模型选择继续听还是输出文字。自适应延迟用强化学习训练,把词错误奖励和延迟奖励相乘,难词就多等一会儿。

  3. 3

    说话人分离和端点检测共享识别遍

    特殊标记说话人切换、说话人标签 A–Z(20+ 人)、语音 onset 和 endpoint。Meta 称超过一小时的长音频也不需要额外后处理流程。

  4. 4

    训练 70+ 语,验证 25 语

    首发 Meta 建议先用这 25 种充分验证的语言,其余也可试。句内和句间语码转换是原生的。语言、关键词和上下文偏置可以提高专名和行话的准确率。

  5. 5

    每小时 0.18 美元,外加一份独立流式榜

    Meta 文档列出处理一小时音频 0.18 美元。Meta 称截至 2026-09-01 在 Artificial Analysis 流式语音转写和公开说话人分离榜上排名第一。VentureBeat 引用发布图:AA-WER Streaming 最终稿词错误率 3.1%。

BibiGPT 用户的 3 个典型场景

实时语音识别 API 哪里重要——以及「链接变笔记」产品真正要干的活在哪。

你在做语音助手

需要 WebSocket 部分结果和模型检测话轮边界的团队,可以评估 Meta Model API。然后再把成品录音丢进 BibiGPT,让人拿到章节,而不是一串原始事件。

你只想把课堂录音转成文字

九十分钟讲座不需要实时语音识别套接字。粘贴 URL 或拖入 M4A,导出带时间戳的文字稿,继续追问。这就是产品路径。

你在跟踪 2026 的语音发布

Muse Voice Transcribe 是 Meta 09-01 的流式语音识别。Granite Speech 5.0 Turbo CTC 是 IBM 的英语吞吐权重。Gemini 3.5 Transcribe 于 2026-08-26 发布,直播和文件是不同接口。每个家族各留一个 URL;不要合成一张笼统的「2026 语音识别」页。

相关 BibiGPT 工具

与这次发布配套的转写与笔记工作流。

来源

发布事实来自 Meta 自家文章。标价和流式榜图的独立报道另行标注。

  • 2026-09-01,Meta Superintelligence Labs 发布 Muse Voice Transcribe,作为 Muse Spark 家族首个实时音频感知模型:80ms 流式语音识别、20+ 说话人分离、端点检测、训练 70+ 语(25 语充分验证)、原生语码转换、原生支持超过一小时长音频。Meta 称截至 2026-09-01 在 Artificial Analysis 流式语音转写榜排名第一。

    Meta AI Research — Introducing Muse Voice Transcribe ↗
  • Meta 语音转文字文档列出模型 muse-voice-transcribe-1.0、实时 WebSocket 与文件 POST 接口、处理一小时音频 0.18 美元、话轮级时间戳(不是词级),以及 25 种评测语言与语码转换。

    Meta AI Developer — Speech to text ↗
  • VentureBeat(2026-09)报道 0.18 美元/小时标价,并引用 Meta 发布图:Artificial Analysis AA-WER Streaming 最终稿词错误率 3.1%,高于该图上列出的其他流式系统。

    VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗
  • Gemini 3.5 Transcribe(2026-08-26)是 Google 另一次发布:Google 引用的 Artificial Analysis 数字为流式 WER 4.0%、非流式 WER 2.6%,覆盖 85+ 语言。直播和文件是不同接口。数据时点 2026-08。

    Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗

本页用到的术语

什么是流式语音识别?

流式自动语音识别在音频还在进入时就把声音变成文字,而不是等文件结束。先出现部分文字,后面可以改。这是延迟设计,不是品牌名。

什么是说话人分离?

说话人分离给录音里「谁在何时说话」打标签。系统给话轮分配说话人标记,会议稿才能把不同声音分开。宣称覆盖 20 人以上,只说明标签集合够大,并不等于认出每个人的名字。

语音识别里的端点检测是什么?

端点检测标记一段话的起止,让语音助手知道何时停止收听、开始回答。这是话轮切换,不是标点。模型吐出 onset 和 结束标记,而不是等人按停止键。

深受创作者、学生和研究人员的喜爱

看看大家为什么每天都用 BibiGPT 把视频转成文字。

全球 50,000+ 用户的信赖之选

★★★★★

“贴上链接几秒钟就拿到干净的字幕文字,每周帮我省下好几个小时的手动整理时间。”

Maya R.

内容创作者 · 二次创作短视频

★★★★★

“导出逐字稿后我可以按自己的节奏复习生词,再也不用反复暂停视频了。”

Daniel K.

语言学习者 · 用真实视频学外语

★★★★★

“准确、带时间戳的文字可以直接引用,它已经悄悄成为我日常工作流的一部分。”

Priya S.

研究人员 · 引用公开演讲

常见问题解答

有问题?问我们!

热门文章

跳过 API 握手,在这里语音转文字

粘贴 YouTube、B 站或播客链接——或拖入 MP3、WAV、M4A。BibiGPT 返回带时间戳的文字稿、AI 总结,以及能搜索的笔记。最近更新:2026-09-07。