Normal metinden sese sistemlerinde genelde birkaç dakikayı geçmek zordu, ancak bu yapay zeka uzun formatta içerik üretmeye izin veriyor ve üstelik sesler daha doğal ve akıcı, duyguyu ve tonlamayı hissetmek mümkün.VibeVoice’ın dikkat çeken yanı uzun süreli içerik üretebiliyor olması. Sistem 90 dakikaya kadar kesintisiz ses üretebiliyor.
VibeVoice, 'next-token difüzyon' adı verilen bir yöntem kullanıyor. Bu yöntem, sesin akışını ve ritmini tahmin ederek, sıradaki konuşma birimini oluşturuyor.
Peki Bunun Hayatımıza Etkisi Ne Olacak?
- Podcast üreticileri artık yazılı içeriklerini anında sesli hale getirebilecekler.
- Görme engelli kullanıcılar, metinleri kolayca dinleyebilecekler.
- Eğitim materyalleri ve ders içerikleri sesli olarak sunulabilecek.
- Yapay zeka asistanları artık daha doğal ve çok sesli konuşmalar yapabilecek.