Teknoloji

Meta’nın yeni ses modeli konuşmanın ortasında dil değişse bile takip edebiliyor

Meta’nın yeni ses modeli konuşmanın ortasında dil değişse bile takip edebiliyor
Haberleri Kaçırma! Teknoblog'u Google Arama'da tercihli kaynağın yap ve En Çok Okunan Haberler'de bizi daha sık gör.
Tercihli Kaynak Ekle

Meta, gerçek zamanlı ses işleme alanındaki ilk modeli Muse Voice Transcribe’ı tanıttı. Yeni yapay zekâ modeli, aynı ses kaydı veya görüşme içinde 20’den fazla konuşmacıyı birbirinden ayırabiliyor ve birden fazla dilin kullanıldığı konuşmaları eş zamanlı olarak yazıya aktarabiliyor. Meta’nın verdiği bilgilere göre sistem, konuşmanın ortasında dil değiştirilmesi durumunda da hangi kelimenin hangi dile ait olduğunu belirleyerek transkripsiyonu sürdürebiliyor. Modelin eğitimi 70’ten fazla dili kapsarken, kullanıma sunulduğu aşamada bunların 25’i doğrulanmış durumda. Muse Voice Transcribe şimdilik Meta AI’ın Mac uygulaması üzerinden kullanılabildiği gibi geliştiricilere yönelik araçlarda da yerini alıyor.

Meta CEO’su Mark Zuckerberg, Muse Voice Transcribe’ın yeteneklerini gösteren bir örneği X hesabından paylaştı. Zuckerberg’in yaklaşık üç yıllık bir aranın ardından yeniden paylaşım yapmaya başladığı platformdaki videoda modelin birden fazla konuşmacıyı otomatik olarak ayırt ettiği ve konuşma sırasında kullanılan dile göre transkripsiyonu değiştirdiği görülüyor. Bunun yanında sistem, dil biliminde “code-switching” olarak adlandırılan ve aynı cümle içerisinde birden fazla dilden kelimelerin kullanılabildiği konuşma biçimini de işleyebiliyor. Böylelikle özellikle çok dilli toplantılar, röportajlar ve uluslararası ekiplerin görüşmeleri gibi geleneksel otomatik transkripsiyon sistemlerinin zorlanabildiği kullanım senaryolarına odaklanılıyor. Konuşmacı ayrımının otomatik yapılması da uzun kayıtların daha sonra düzenlenmesini kolaylaştırabilecek özelliklerden biri olarak öne çıkıyor.

Muse Voice Transcribe 20’den fazla konuşmacıyı ayırt edebiliyor

Muse Voice Transcribe’ın çalışma biçimindeki dikkat çekici ayrıntılardan biri, modelin her kelimeyi aynı gecikmeyle işlememesi. Zuckerberg’in verdiği bilgiye göre sistem, ne zaman dinlemeye devam edeceğine ve ne zaman elde ettiği sonucu kesinleştireceğine dinamik biçimde karar veriyor. Tahmin edilmesi daha zor kelimelerde biraz daha uzun bekleyen model, kolay kelimelerde ise daha hızlı sonuç üretebiliyor. Meta bu uyarlanabilir gecikme yaklaşımıyla her bir token için tahmin doğruluğunu yükseltmeyi amaçlıyor. Üstelik model yalnızca temiz stüdyo kayıtları için tasarlanmış değil; şirket, günlük kullanımda karşılaşılabilecek daha düzensiz ve gürültülü gerçek ses kayıtlarında da sistemin çalışabildiğini belirtiyor.

Uzun süreli kayıtlar da Muse Voice Transcribe’ın hedeflediği alanlar arasında bulunuyor. Meta’nın açıklamasına göre model, 20’den fazla kişinin yer aldığı ve bir saate ulaşan oturumları işleyebiliyor. Bu kapasite toplantı tutanaklarının hazırlanması, röportajların çözümlenmesi veya birden fazla kişinin katıldığı ses kayıtlarının arşivlenmesi gibi işlerde kullanılabilir. Buna karşılık gerçek kullanım koşullarındaki başarı yalnızca desteklenen konuşmacı sayısıyla ölçülmeyecektir. Arka plan gürültüsü, insanların aynı anda konuşması, farklı aksanlar ve teknik terimler otomatik transkripsiyon sistemlerinde doğruluğu etkileyebilen unsurlar olmaya devam ediyor. Meta’nın uyarlanabilir gecikme yöntemi bu tür durumlarda doğruluğa katkıda bulunabilirken, sistemin gecikme ve doğruluk arasındaki dengeyi farklı koşullarda nasıl kurduğu daha geniş çaplı kullanımla daha net anlaşılacaktır.

Meta’nın duyurusu, Google’ın benzer özelliklere sahip Gemini 3.5 Transcribe modelini açıklamasından bir haftadan kısa süre sonra geldi. Google kendi ses modelini Android’e entegre ederken Chrome desteğinin de daha sonra sunulmasını planlıyor. Meta tarafında ise Muse Voice Transcribe’ın WhatsApp, Instagram veya şirketin diğer yaygın servislerine doğrudan eklenip eklenmeyeceği konusunda henüz açıklanmış bir plan bulunmuyor. Buna rağmen model, kısa süre önce kullanıma sunulan Meta AI Mac uygulamasında şimdiden erişilebilir durumda. Mac uygulamasının diğer uygulamalardaki ses özelliklerini destekleyebilmesi sayesinde Muse Voice Transcribe, farklı servislerdeki dikte işlemlerinin arkasındaki model olarak da çalışabiliyor.

Günün Öne Çıkan Fırsatları

M5’li 13 inç iPad Pro 1.477,88 TL indirimle 75.499 TL
M5’li 13 inç iPad Pro 1.477,88 TL indirimle 75.499 TL
Satın Al
Carlover S12, 4K araç kaydını yüzde 25 indirimle 1.498,99 TL’ye getiriyor
Carlover S12, 4K araç kaydını yüzde 25 indirimle 1.498,99 TL’ye getiriyor
Satın Al
Dahili çift kablolu Baseus EnerFill FC31 sepette 447,80 TL ucuz
Dahili çift kablolu Baseus EnerFill FC31 sepette 447,80 TL ucuz
Satın Al
8 mm inceliğindeki Qi2 powerbank sepette 3.599,10 TL’ye geliyor
8 mm inceliğindeki Qi2 powerbank sepette 3.599,10 TL’ye geliyor
Satın Al
Galaxy SmartTag2, Premium ile 1.499 TL’ye düşüyor
Galaxy SmartTag2, Premium ile 1.499 TL’ye düşüyor
Satın Al
Tümünü Gör Daralt
Tüm Fırsatları Gör

REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.

Geliştiriciler Muse Voice Transcribe’a Muse Code ve Meta Model API üzerinden de erişebiliyor. Meta, API kullanımını 1000 dakikalık ses için 3 dolar olarak fiyatlandırıyor. Bunun yanında şirketin araştırma blogunda Muse Transcribe’ın yeteneklerinin denenebildiği bir demo da bulunuyor. Böylece Meta modeli yalnızca kendi tüketici uygulamalarına bağlı tutmak yerine yazılım geliştiricilerinin farklı ürün ve hizmetlerde kullanabileceği bir seçenek hâline getiriyor. Özellikle çok dilli görüşmeleri işleyen uygulamalar açısından aynı oturum içinde konuşmacı ayrımı ve dil değişikliklerinin otomatik olarak ele alınması, ek işlem ihtiyacını azaltabilecek özellikler sunuyor.

Muse Voice Transcribe, Meta Superintelligence Labs tarafından son haftalarda duyurulan yapay zekâ araçlarının en yenisi oldu. Şirket bu dönemde ilk özel kodlama ajanını, açık ağırlıklı bir modeli ve Meta AI Mac uygulamasını da kullanıma sundu. Ses modelinin öne çıkan tarafı ise çok dilli konuşmaları, konuşmacı ayrımını ve uzun oturumları tek bir gerçek zamanlı sistem içinde ele alabilmesi. Buna karşılık modelin Meta’nın geniş kullanıcı kitlesine ulaşan uygulamalarındaki kullanım alanları henüz netleşmiş değil. Mevcut durumda Muse Voice Transcribe daha çok Mac uygulaması, API erişimi ve geliştirici araçları üzerinden kullanılabilen bir teknoloji olarak konumlanıyor; günlük kullanım açısından ne kadar etkili olacağını ise farklı dil, aksan ve kayıt koşullarındaki performansı belirleyecek.

Teknoblog artık WhatsApp'taGünün en iyi teknoloji fırsatları ve kaçırmamanız gereken büyük haberler, telefonunuza gelsin.
Kanala Katıl