Yapay zeka ile üretilen ses modelleri pazarı son derece geniş bir alana yayılıyor. Yaratıcı kullanımlar, AI ses modellerinin daha ifade edici olmasını gerektirirken, müşteri destek ve satış otomasyonu arayan işletmelerin ise bu modellerin daha yönlendirilebilir olmasını talep ettiği görülüyor.
YENİ YATIRIMLA BÜYÜME HEDEFİ
Palo Alto merkezli Fish Audio, 15.000'den fazla doğal dil kontrolü ile bu ihtiyaçların hepsini karşılamak istiyor. Geçtiğimiz yıl piyasaya sürülen startup, bugün açık kaynak veya barındırılan modellerinin 8 milyondan fazla kullanıcıya ulaştığını ve yıllık tekrarlayan gelirinin 21 milyon dolar olduğunu duyurdu. Şirket, bu ivmeyi sürdürmek adına Salı günü Coreline Ventures ve Capital Today liderliğinde 50 milyon dolarlık bir tohum yatırımı aldığını açıkladı.
KULLANICI TEMELLİ YAKLAŞIM
Fish Audio, eski NVIDIA araştırmacısı Shijia Liao tarafından başlatılan küçük bir projeydi. Piyasada mevcut olan ifadesiz sentetik seslerden duyduğu rahatsızlıkla, tek bir GPU üzerinde bir ses üretim modeli geliştirdi ve bunu açık kaynak olarak paylaştı. GitHub'daki Fish Speech deposu, 31.000'den fazla yıldız aldı ve bağımsız geliştiriciler ile video oyun tasarımcıları tarafından kullanılmaya başlandı. Şirket, son bir yılda dört konuşma üretim modeli ve bir konuşma metne çevirme modeli olmak üzere toplamda beş model piyasaya sürdü ve kullanıcıların kendi seslerini model eğitimi için sunmalarını isteyerek ses kütüphanesini oluşturdu.

