Yapay zeka ses teknolojisi henüz tam potansiyeline ulaşmadı

Ses teknolojisinin geleceğin en önemli arayüzü olacağına dair inanç güçleniyor. Yatırımcılar, model geliştiricilerden kurumsal müşteri hizmetlerine, toplantı notu tutan uygulamalardan sesli dikteye kadar geniş bir alanda çalışan yapay zeka ses girişimlerine milyarlarca dolar akıtıyor. Her hafta insan gibi konuşabildiğini iddia eden yeni modeller veya araçlar piyasaya sürülüyor. Ancak gerçekler farklı olabilir.

İnsan benzeri konuşma için daha yol var

Kurumsal ses yapay zeka platformu PolyAI'nin teknoloji direktörü Shawn Wen, tam çift yönlü (full-duplex) modellerin piyasaya sürülmesine rağmen, ses yapay zekasının henüz "ChatGPT anına" ulaşmadığını düşünüyor. Wen, "Tam çift yönlü modeller geliştirme aşamasını geçtik. Bir sonraki zorluk, modellerin cevapları hızla alabildiği ve konuşmanın doğal hissettirdiği, akıl yürütmeyi çok hızlı hale getirmek" dedi. Müşteri hizmetlerindeki yapay zeka ajanlarının robotik duyulmaması ve arayanlara sorunları çözebileceklerine dair güven vermesi gerektiğini de ekledi. Wen'e göre, ses kalitesi yeterince iyi olduğunda ve müşteri ilk iki veya üç etkileşimde bulunmaya istekli olduğunda, güven inşa ediliyor ve zamanla, "Eğer ajan sorunumu çözebiliyorsa insanla konuşmama gerek kalmayacak" hissi oluşuyor.

Şeffaflık ve doğruluk kritik önemde

Toplantı notu tutucu Otter'ın pazarlama müdürü Alex Gay, konuşmacı tanımlama, niyet yakalama ve bunu kurumsal bilgiyle birleştirmenin otomasyon için önemli bir adım olduğunu belirtti. Şirket ayrıca toplantılarda insanları temsil edebilecek dijital ikizler üzerinde de çalışıyor. Gay, bu teknoloji için çıktı sesinin, bir insanla toplantı yapıyormuş gibi aynı duygusal ifadeleri vermesinin şart olduğunu söyledi. "Şu anki toplantılarınızda en iyi sohbetler, tartışma ve stratejik konuşmalar yapabildiğiniz, altında bir ilişki olduğunu hissettiğiniz anlardır. Bir avatarla bunu yaşayamazsanız, o sadece bir soru-cevap sohbet botudur" diye ekledi. Ses yapay zeka modelleri gelişmiş olsa da, yapay zeka asistanları genellikle kullanıcıları anlamıyor veya toplantı notu tutucu yanlış bir transkript veya özet sunabiliyor. Wen, otomatik konuşma tanıma (ASR) modellerinin sıklıkla önemli anahtar kelimeleri kaçırdığını ve bunun tüm bağlamı yakalamada sorun yarattığını düşünüyor. Otter'dan Gay de bu duruma katılarak şirketin transkripsiyonu iyileştirmek için çalıştığını belirtti. Gay, dilin ses modellerinin gelişmesi gereken bir alan olduğunu vurguladı. "Otter için transkripsiyon hiçbir zaman son nokta olmadı. Sadece bunun üzerine bazı üretkenlik artışları sağlayabileceğimiz bir katmandı. Ancak orijinal transkriptinizde ihtiyacınız olan doğruluğu bulamazsanız, takip eden tüm eylemleriniz kusurlu hale gelir. Ve yanlış bir eylem başlar başlamaz, platforma olan güveni kaybedersiniz. Bu ASR modelini geliştirmeye devam etmemiz bizim için kritik, çünkü tüm sonraki etkiler önemli" dedi. Yeni ses araçlarıyla birlikte şeffaflık sorusu da gündeme geliyor. Araçlar, müşterilere kaydedildiklerini veya yapay zeka ile konuştuklarını bildirmelidir. Otter, toplantıdaki insanlara güven aşılamak istediğini ve botun bulunmadığı bir toplantı için bile, herkesi sohbet yoluyla toplantının kaydedildiği konusunda bilgilendirme gibi yöntemler denemek istediğini belirtti. PolyAI'den Wen de kurumsal aramalarda insanların bir yapay zeka ile konuştuğunu belirtmenin önemli olduğunu söyledi.

Sitemizin daha işlevsel hale getirilmesi için yasal mevzuata uygun çerezler kullanılır. Fikrini Söyle’yi kullanarak bu çerezleri kabul etmiş olursunuz. Çerez kullanımına ilişkin detaylı bilgilere çerez politikamız'dan ulaşabilirsiniz.