什么是流式语音识别?
流式自动语音识别在音频还在进入时就把声音变成文字,而不是等文件结束。先出现部分文字,后面可以改。这是延迟设计,不是品牌名。
截至 2026-09-07:Meta Superintelligence Labs 于 2026-09-01 发布 Muse Voice Transcribe,以 80ms 分块做实时流式语音识别,同一模型覆盖 20+ 说话人分离和端点检测。Meta 称截至 2026-09-01 在 Artificial Analysis 流式语音转写榜上排名第一。若你只想把文件或讲座链接转成文字,用下面的工具即可,不必打开 Meta API 控制台。
Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.
截至 2026-09-07:Meta Superintelligence Labs 于 2026-09-01 发布 Muse Voice Transcribe。这是实时音频感知模型:80ms 流式语音识别、20+ 说话人分离、端点检测,一遍完成。Meta 称截至 2026-09-01 在 Artificial Analysis 流式语音转写榜排名第一。Meta Model API 标价每小时音频 0.18 美元。最近更新:2026-09-07。
这是 Meta Superintelligence Labs 的托管实时音频感知模型,属于 Muse Spark 家族。它不是 Muse Image。Meta 文档里的模型 ID 是 muse-voice-transcribe-1.0。
音频按 80ms、12.5 Hz 分块。模型自己决定是继续听还是吐出一个文字片段。Meta 称之为自适应延迟:用强化学习在「多等一会儿」和「词更准」之间做权衡。
说话人标签覆盖 20 人以上。端点标记语音起止。Meta 称不需要单独的后处理步骤。这些说法以研究页为准。
Meta 语音转文字文档列出:处理一小时音频 0.18 美元(每 1000 分钟 3 美元),流式和文件上传同价。没有开源权重。Mac 上 Meta AI 和 Muse Code 的语音听写已经在用这个模型。
实时语音识别 API 帮的是在做语音助手的团队。它替代不了给人类归档带时间戳的文字稿、章节和追问的产品——后者往往只需要粘一条链接。
粘贴讲座或播客链接,或拖入 MP3。要的是能搜索的文字稿,不是去握 wss://api.meta.ai/v1/asr/realtime 这根 WebSocket。
流式原文仍要人读。BibiGPT 吃同一份文件或链接,返回章节、带时间戳的文字稿,以及可以追问的笔记。
Muse Image 是 Meta 另一次 2026 发布。每种意图各留一个 URL。本页只覆盖 09-01 的语音模型。
来自 Meta 2026-09-01 Muse Voice Transcribe 发布的核心事实。
Meta Superintelligence Labs 以 muse-voice-transcribe-1.0 上线。可通过 Meta Model API、Mac 版 Meta AI 和 Muse Code 使用。没有开源权重。在 Mac 上按住 Fn,即可通过 Meta AI 听写。
音频每 80ms(12.5 Hz)变成一个文字单元。模型选择继续听还是输出文字。自适应延迟用强化学习训练,把词错误奖励和延迟奖励相乘,难词就多等一会儿。
特殊标记说话人切换、说话人标签 A–Z(20+ 人)、语音 onset 和 endpoint。Meta 称超过一小时的长音频也不需要额外后处理流程。
首发 Meta 建议先用这 25 种充分验证的语言,其余也可试。句内和句间语码转换是原生的。语言、关键词和上下文偏置可以提高专名和行话的准确率。
Meta 文档列出处理一小时音频 0.18 美元。Meta 称截至 2026-09-01 在 Artificial Analysis 流式语音转写和公开说话人分离榜上排名第一。VentureBeat 引用发布图:AA-WER Streaming 最终稿词错误率 3.1%。
实时语音识别 API 哪里重要——以及「链接变笔记」产品真正要干的活在哪。
需要 WebSocket 部分结果和模型检测话轮边界的团队,可以评估 Meta Model API。然后再把成品录音丢进 BibiGPT,让人拿到章节,而不是一串原始事件。
九十分钟讲座不需要实时语音识别套接字。粘贴 URL 或拖入 M4A,导出带时间戳的文字稿,继续追问。这就是产品路径。
Muse Voice Transcribe 是 Meta 09-01 的流式语音识别。Granite Speech 5.0 Turbo CTC 是 IBM 的英语吞吐权重。Gemini 3.5 Transcribe 于 2026-08-26 发布,直播和文件是不同接口。每个家族各留一个 URL;不要合成一张笼统的「2026 语音识别」页。
与这次发布配套的转写与笔记工作流。
发布事实来自 Meta 自家文章。标价和流式榜图的独立报道另行标注。
2026-09-01,Meta Superintelligence Labs 发布 Muse Voice Transcribe,作为 Muse Spark 家族首个实时音频感知模型:80ms 流式语音识别、20+ 说话人分离、端点检测、训练 70+ 语(25 语充分验证)、原生语码转换、原生支持超过一小时长音频。Meta 称截至 2026-09-01 在 Artificial Analysis 流式语音转写榜排名第一。
Meta AI Research — Introducing Muse Voice Transcribe ↗Meta 语音转文字文档列出模型 muse-voice-transcribe-1.0、实时 WebSocket 与文件 POST 接口、处理一小时音频 0.18 美元、话轮级时间戳(不是词级),以及 25 种评测语言与语码转换。
Meta AI Developer — Speech to text ↗VentureBeat(2026-09)报道 0.18 美元/小时标价,并引用 Meta 发布图:Artificial Analysis AA-WER Streaming 最终稿词错误率 3.1%,高于该图上列出的其他流式系统。
VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗Gemini 3.5 Transcribe(2026-08-26)是 Google 另一次发布:Google 引用的 Artificial Analysis 数字为流式 WER 4.0%、非流式 WER 2.6%,覆盖 85+ 语言。直播和文件是不同接口。数据时点 2026-08。
Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗流式自动语音识别在音频还在进入时就把声音变成文字,而不是等文件结束。先出现部分文字,后面可以改。这是延迟设计,不是品牌名。
说话人分离给录音里「谁在何时说话」打标签。系统给话轮分配说话人标记,会议稿才能把不同声音分开。宣称覆盖 20 人以上,只说明标签集合够大,并不等于认出每个人的名字。
端点检测标记一段话的起止,让语音助手知道何时停止收听、开始回答。这是话轮切换,不是标点。模型吐出 onset 和 结束标记,而不是等人按停止键。
看看大家为什么每天都用 BibiGPT 把视频转成文字。
全球 50,000+ 用户的信赖之选
“贴上链接几秒钟就拿到干净的字幕文字,每周帮我省下好几个小时的手动整理时间。”
Maya R.
内容创作者 · 二次创作短视频
“导出逐字稿后我可以按自己的节奏复习生词,再也不用反复暂停视频了。”
Daniel K.
语言学习者 · 用真实视频学外语
“准确、带时间戳的文字可以直接引用,它已经悄悄成为我日常工作流的一部分。”
Priya S.
研究人员 · 引用公开演讲
常见问题
有问题?问我们!
1 给 DeepSeek Harness 装视频总结 skill 只需拷贝目录——SKILL.md 和 Claude Code 通用。也可以不装 dsh:在浏览器里粘贴 B 站或 YouTube 链接,直接出带时间戳的总结。
2 2026年B站AI视频总结工具哪个最好?粘贴任意链接,几秒生成结构化总结、思维导图和重点提炼,支持30+平台、免登录。文末对比5大工具,选出最适合你的那一个。
3 海外用户如何提取B站视频字幕?2026 更新版横向对比5款主流bilibili transcript工具,从字幕提取、AI总结到格式导出全面评测,看BibiGPT如何凭借原生B站支持脱颖而出。
粘贴 YouTube、B 站或播客链接——或拖入 MP3、WAV、M4A。BibiGPT 返回带时间戳的文字稿、AI 总结,以及能搜索的笔记。最近更新:2026-09-07。