وفقًا لـ 9to5Mac، أطلقت Meta في 2 سبتمبر نموذج Muse Voice Transcribe، وهو أول نموذج لها لفهم الكلام في الوقت الفعلي، وأتاحته عبر Meta Model API. ويبلغ سعر النموذج 3 دولارات لكل 1,000 دقيقة من الصوت (نحو 0.18 دولار في الساعة). ويدمج النموذج التعرف التلقائي على الكلام المتدفق، وتمييز المتحدثين، واكتشاف نقاط انتهاء الكلام، ما يتيح للمستخدمين الحصول على النص المفرغ في الوقت الفعلي دون انتظار اكتمال التسجيل. ويدعم Muse Voice Transcribe أكثر من 70 لغة (تم التحقق من 25 لغة منها)، ويعالج تسجيلات تتجاوز مدتها ساعة واحدة، كما يمكنه تمييز أكثر من 20 متحدثًا في تسجيل واحد، مع توفير مسارات صوتية منفصلة لكل متحدث.
واعتبارًا من 1 سبتمبر، يتصدر النموذج لوحة صدارة تحويل الكلام إلى نص المتدفق التابعة لـ Artificial Analysis.