อธิบาย Muse Voice Transcribe — Meta ปล่อยอะไรเมื่อ 2026-09-01

ณ 2026-09-07: Meta Superintelligence Labs เปิดตัว Muse Voice Transcribe เมื่อ 2026-09-01 เป็น ASR สตรีมมิงเรียลไทม์ก้อนละ 80ms โมเดลเดียวกันครอบคลุมการแยกผู้พูด 20+ และการตรวจจับ endpoint Meta ระบุว่าอยู่อันดับหนึ่งในกระดาน speech-to-text สตรีมมิงของ Artificial Analysis ณ 2026-09-01 ถ้าต้องการแค่แปลงไฟล์หรือลิงก์บรรยายเป็นข้อความ ใช้เครื่องมือด้านล่างได้เลย ไม่ต้องเปิดคอนโซล Meta API

เปิดตัว · 2026-09-01 ASR สตรีมมิง 80ms ลองด้านล่าง

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.

เพิ่ม BibiGPT เป็นแหล่งข้อมูลที่ต้องการบน Google เห็น BibiGPT มากขึ้นใน Top Stories และคำตอบจาก AI

ข้อเท็จจริงหลัก (90 วินาที)

ณ 2026-09-07: Meta Superintelligence Labs เปิด Muse Voice Transcribe เมื่อ 2026-09-01 เป็นโมเดลรับรู้เสียงเรียลไทม์: ASR สตรีมมิง 80ms, แยกผู้พูด 20+, ตรวจจับ endpoint ในรอบเดียว Meta ระบุว่าอยู่อันดับหนึ่งในกระดาน speech-to-text สตรีมมิงของ Artificial Analysis ณ 2026-09-01 Meta Model API ราคา 0.18 ดอลลาร์ต่อชั่วโมงเสียง อัปเดตล่าสุด: 2026-09-07

Features

Muse Voice Transcribe คืออะไรจริง ๆ

เป็นโมเดลรับรู้เสียงเรียลไทม์ที่ Meta Superintelligence Labs โฮสต์ อยู่ในตระกูล Muse Spark ไม่ใช่ Muse Image รหัสโมเดลในเอกสาร Meta คือ muse-voice-transcribe-1.0

ASR สตรีมมิง 80ms (2026-09-01)

เสียงถูกตัดก้อนละ 80ms ที่ 12.5 Hz โมเดลตัดสินเองว่าจะฟังต่อหรือส่งโทเคนข้อความ Meta เรียกสิ่งนี้ว่าความหน่วงแบบปรับได้: การเรียนรู้แบบเสริมกำลังถ่วงระหว่าง 「รออีกนิด」 กับ 「คำแม่นกว่า」

แยกผู้พูดและ endpoint ในรอบเดียว

ป้ายผู้พูดครอบคลุมเกิน 20 คน โทเคน endpoint ทำเครื่องหมายต้นและท้ายคำพูด Meta ระบุว่าไม่ต้องมีขั้นตอนหลังประมวลผลแยก ยึดหน้าวิจัยเป็นหลัก

0.18 ดอลลาร์ต่อชั่วโมงเสียง เฉพาะ API

เอกสาร speech-to-text ของ Meta ระบุ 0.18 ดอลลาร์ต่อชั่วโมงเสียง (3 ดอลลาร์ต่อ 1000 นาที) สตรีมมิงกับอัปโหลดไฟล์ราคาเท่ากัน ไม่มีน้ำหนักโอเพนซอร์ส การพิมพ์ตามเสียงใน Meta AI for Mac และ Muse Code ใช้โมเดลนี้แล้ว

ถ้าคุณจัดการเสียงยาว นี่หมายความว่าอะไร

API ASR เรียลไทม์ช่วยทีมที่ทำผู้ช่วยเสียง มันไม่แทนผลิตภัณฑ์ที่เก็บถอดเสียงมีไทม์สแตมป์ บท และคำถามต่อเนื่องให้คน — ส่วนหลังมักแค่แปะลิงก์

ไม่ต้องเปิดคอนโซล Model API

แปะลิงก์บรรยายหรือพอดแคสต์ หรือลาก MP3 สิ่งที่ต้องการคือถอดเสียงค้นหาได้ ไม่ใช่ WebSocket wss://api.meta.ai/v1/asr/realtime

ถอดเสียงคือชั้นอินเทอร์เฟซ ไม่ใช่สินค้าสำเร็จ

ข้อความสตรีมมิงยังต้องมีคนอ่าน BibiGPT กินไฟล์หรือลิงก์ชุดเดียวกัน แล้วคืนบท ถอดเสียงมีไทม์สแตมป์ และโน้ตที่ถามต่อได้

นี่คือ Voice Transcribe ไม่ใช่ Muse Image

Muse Image เป็นอีกการเปิดตัวของ Meta ในปี 2026 แต่ละเจตนาควรมี URL ของตัวเอง หน้านี้ครอบคลุมเฉพาะโมเดลเสียง 09-01

5 การเปลี่ยนแปลงสำคัญ (90 วินาที)

ข้อเท็จจริงหลักจากการเปิดตัว Muse Voice Transcribe ของ Meta เมื่อ 2026-09-01

  1. 1

    เปิด 2026-09-01 โฮสต์อย่างเดียว

    Meta Superintelligence Labs ปล่อย muse-voice-transcribe-1.0 ใช้ได้ผ่าน Meta Model API, Meta AI for Mac และ Muse Code ไม่มีน้ำหนักโอเพนซอร์ส บน Mac กด Fn ค้างเพื่อพิมพ์ตามเสียงผ่าน Meta AI

  2. 2

    ก้อน 80ms และความหน่วงแบบปรับได้

    เสียงทุก 80ms (12.5 Hz) กลายเป็นโทเคน โมเดลเลือกฟังต่อหรือส่งข้อความ ความหน่วงแบบปรับได้ฝึกด้วยการเรียนรู้แบบเสริมกำลัง คูณรางวัลคำผิดกับรางวัลความหน่วง — คำยากรอนานกว่า

  3. 3

    แยกผู้พูดและ endpoint ใช้รอบรู้จำร่วมกัน

    โทเคนพิเศษทำเครื่องหมายเปลี่ยนผู้พูด ป้าย A–Z (20+ คน) onset และ endpoint Meta ระบุว่าเสียงยาวกว่าหนึ่งชั่วโมงก็ไม่ต้องไปป์ไลน์หลังประมวลผลเพิ่ม

  4. 4

    ฝึก 70+ ภาษา ตรวจ 25 ภาษา

    ช่วงเปิดตัว Meta แนะนำ 25 ภาษาที่ตรวจแล้ว ภาษาที่เหลือลองได้ การสลับรหัสในประโยคและระหว่างประโยคเป็นเนทีฟ ไบแอสภาษา คำสำคัญ และบริบทช่วยชื่อเฉพาะและศัพท์วงการให้แม่นขึ้น

  5. 5

    0.18 ดอลลาร์ต่อชั่วโมงบวกกระดานสตรีมมิงอิสระ

    เอกสาร Meta ระบุ 0.18 ดอลลาร์ต่อชั่วโมงเสียง Meta ระบุว่าอยู่อันดับหนึ่งในกระดาน speech-to-text สตรีมมิงและการแยกผู้พูดสาธารณะของ Artificial Analysis ณ 2026-09-01 VentureBeat อ้างสไลด์เปิดตัว: AA-WER Streaming อัตราคำผิดฉบับสุดท้าย 3.1%

3 สถานการณ์แบบฉบับของผู้ใช้ BibiGPT

API ASR เรียลไทม์สำคัญตรงไหน — และงานจริงของผลิตภัณฑ์ 「ลิงก์เป็นโน้ต」 อยู่ตรงไหน

คุณกำลังทำผู้ช่วยเสียง

ทีมที่ต้องการผลบางส่วนผ่าน WebSocket และการตรวจขอบเทิร์นประเมิน Meta Model API ได้ จากนั้นส่งไฟล์บันทึกสำเร็จเข้า BibiGPT ให้คนได้บท ไม่ใช่แถวเหตุการณ์ดิบ

อยากแค่ถอดเสียงบรรยายในชั้น

บรรยาย 90 นาทีไม่ต้องการซ็อกเก็ต ASR เรียลไทม์ แปะ URL หรือวาง M4A ส่งออกถอดเสียงมีไทม์สแตมป์ แล้วถามต่อ นั่นคือเส้นทางผลิตภัณฑ์

คุณติดตามการเปิดตัวเสียงปี 2026

Muse Voice Transcribe คือ ASR สตรีมมิง 09-01 ของ Meta Granite Speech 5.0 Turbo CTC คือน้ำหนัก throughput ภาษาอังกฤษของ IBM Gemini 3.5 Transcribe ออก 2026-08-26 ไลฟ์กับไฟล์เป็น API คนละตัว แต่ละตระกูลควรมี URL ของตัวเอง อย่าประกอบหน้า 「ASR 2026」 แบบกว้าง ๆ

เครื่องมือ BibiGPT ที่เกี่ยวข้อง

เวิร์กโฟลว์ถอดเสียงและโน้ตที่คู่กับการเปิดตัวนี้

แหล่งที่มา

ข้อเท็จจริงการเปิดตัวมาจากบทความของ Meta เอง ราคาและสไลด์กระดานสตรีมมิงจากรายงานอิสระระบุแยก

  • 2026-09-01 Meta Superintelligence Labs เปิด Muse Voice Transcribe เป็นโมเดลรับรู้เสียงเรียลไทม์แรกของตระกูล Muse Spark: ASR สตรีมมิง 80ms, แยกผู้พูด 20+, ตรวจจับ endpoint, ฝึก 70+ ภาษา (25 ภาษาตรวจแล้ว), สลับรหัสเนทีฟ, รองรับเนทีฟเสียงยาวกว่าหนึ่งชั่วโมง Meta ระบุว่าอยู่อันดับหนึ่งในกระดาน speech-to-text สตรีมมิงของ Artificial Analysis ณ 2026-09-01

    Meta AI Research — Introducing Muse Voice Transcribe ↗
  • เอกสาร speech-to-text ของ Meta ระบุโมเดล muse-voice-transcribe-1.0, WebSocket เรียลไทม์และ POST ไฟล์, 0.18 ดอลลาร์ต่อชั่วโมงเสียง, ไทม์สแตมป์ระดับเทิร์น (ไม่ใช่ระดับคำ) รวม 25 ภาษาประเมินและการสลับรหัส

    Meta AI Developer — Speech to text ↗
  • VentureBeat (2026-09) รายงานราคา 0.18 ดอลลาร์/ชั่วโมง และอ้างสไลด์เปิดตัวของ Meta: AA-WER Streaming ของ Artificial Analysis อัตราคำผิดฉบับสุดท้าย 3.1% ต่ำกว่าระบบสตรีมมิงอื่นบนสไลด์เดียวกัน

    VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗
  • Gemini 3.5 Transcribe (2026-08-26) เป็นอีกการเปิดตัวของ Google: ตัวเลข Artificial Analysis ที่ Google อ้างคือ WER สตรีมมิง 4.0%, WER นอกสตรีม 2.6%, 85+ ภาษา ไลฟ์กับไฟล์เป็น API คนละตัว จุดข้อมูล 2026-08

    Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗

คำศัพท์ในหน้านี้

ASR สตรีมมิงคืออะไร

การรู้จำเสียงอัตโนมัติแบบสตรีมมิงแปลงเสียงเป็นข้อความขณะที่เสียงยังไหลเข้า ไม่รอไฟล์จบ โทเคนบางส่วนออกมาก่อน แล้วแก้ได้ภายหลัง นี่คือการออกแบบความหน่วง ไม่ใช่ชื่อแบรนด์

การแยกผู้พูดคืออะไร

การแยกผู้พูดติดป้าย 「ใครพูดเมื่อไหร่」 ในบันทึก ระบบกำหนดแท็กผู้พูดให้แต่ละเทิร์น เพื่อให้รายงานประชุมแยกเสียง การครอบคลุม 20+ คนหมายถึงชุดป้ายใหญ่พอ ไม่ได้แปลว่ารู้ชื่อทุกคน

การตรวจจับ endpoint ใน ASR คืออะไร

การตรวจจับ endpoint ทำเครื่องหมายต้นและท้ายคำพูด ให้ผู้ช่วยเสียงรู้ว่าเมื่อไหร่จะหยุดฟังแล้วเริ่มตอบ นี่คือการสลับเทิร์น ไม่ใช่วรรคตอน โมเดลส่งโทเคน onset และ endpoint ไม่รอปุ่มหยุด

เป็นที่ชื่นชอบของครีเอเตอร์ นักเรียน และนักวิจัย

เหตุผลที่ผู้คนใช้ BibiGPT แปลงวิดีโอเป็นข้อความทุกวัน

ผู้ใช้กว่า 50,000 คนทั่วโลกไว้วางใจ

★★★★★

“แค่วางลิงก์ก็ได้ข้อความซับไตเติลที่เรียบร้อยในไม่กี่วินาที ช่วยประหยัดเวลาพิมพ์ซ้ำหลายชั่วโมงทุกสัปดาห์”

Maya R.

ครีเอเตอร์ · นำวิดีโอสั้นมาใช้ใหม่

★★★★★

“การส่งออกทรานสคริปต์ทำให้ฉันทบทวนคำศัพท์ใหม่ตามจังหวะของตัวเอง โดยไม่ต้องกดหยุดวิดีโอตลอดเวลา”

Daniel K.

ผู้เรียนภาษา · เรียนรู้จากวิดีโอจริง

★★★★★

“ข้อความแม่นยำพร้อมไทม์สแตมป์ที่นำไปอ้างอิงได้ทันที กลายเป็นส่วนหนึ่งของงานประจำวันของฉันไปแล้ว”

Priya S.

นักวิจัย · อ้างอิงงานบรรยายสาธารณะ

คำถามที่พบบ่อย

ถามอะไรก็ได้

Popular guides

ข้ามการจับมือ API แปลงเสียงเป็นข้อความที่นี่

แปะลิงก์ YouTube, Bilibili หรือพอดแคสต์ — หรือวาง MP3, WAV, M4A BibiGPT คืนถอดเสียงมีไทม์สแตมป์ สรุปด้วย AI และโน้ตค้นหาได้ อัปเดตล่าสุด: 2026-09-07