Menurut 9to5Mac, pada 2 September Meta meluncurkan Muse Voice Transcribe, model pemahaman audio real-time pertamanya yang tersedia melalui Meta Model API. Model ini dibanderol US$3 per 1.000 menit audio (sekitar US$0,18 per jam). Model ini mengintegrasikan pengenalan ucapan otomatis secara streaming, pemisahan pembicara, dan deteksi titik akhir, sehingga pengguna dapat menerima transkripsi secara real-time tanpa harus menunggu rekaman selesai. Muse Voice Transcribe mendukung lebih dari 70 bahasa (25 di antaranya telah terverifikasi), memproses rekaman berdurasi lebih dari 1 jam, serta dapat membedakan lebih dari 20 pembicara dalam satu rekaman dengan trek audio individual untuk setiap pembicara.
Per 1 September, model ini menempati peringkat pertama dalam papan peringkat streaming speech-to-text Artificial Analysis.