Google, sesli metin dönüştürme süreçlerini hızlandıran ve yanlışları temizleyen yeni Gemini 3.5 Transcribe modelini duyurdu.
Google, sesli metin dönüştürme süreçlerini düzgünleştirmek gayesiyle geliştirdiği Gemini 3.5 Transcribe modelini resmen duyurdu. Bu yeni yapay zeka modeli, sesli girişleri daha süratli ve kusursuz bir halde metne dökme gayesiyle tasarlandı.
Söz konusu teknoloji, halihazırda Pixel 11 aygıtlarda bulunan Gboard Rambler özelliğinde faal olarak kullanılıyor. Google, bu modelin önümüzdeki periyotta tüm ekosistemine yayılacağını açıkladı.
Gemini 3.5 Transcribe ile Hızlı ve Akıcı Dönüşüm
Google’ın evvelki sesli metin dönüştürme motoru olan Chirp 3 ile kıyaslandığında, yeni modelin performansında önemli bir artış gözlemleniyor. Gemini 3.5 Transcribe, sesli datayı sonuncu metne dönüştürme sürecinde yaklaşık yüzde 70 oranında daha yüksek bir sürat sunuyor.
Canlı konuşma sırasındaki kusur oranı ise yüzde 5,5 düzeyine kadar gerilemiş durumda. Chirp 3 modelinde bu oran yüzde 7,32 olarak ölçülüyordu, hasebiyle yeni model daha kararlı bir yapı sergiliyor.
Bu teknoloji yalnızca sözleri yanlışsız duymakla kalmıyor, tıpkı vakitte kullanıcının ne demek istediğini de tahlil edebiliyor. Konuşma sırasında sıkça kullanılan ıı yahut eee üzere gereksiz sözler, model tarafından otomatik olarak temizleniyor.
Ayrıca kullanıcıların kendilerini düzeltmeleri durumunda metin üzerinde anlık düzenlemeler yapılabiliyor. Özel terminolojiye muhtaçlık duyan kullanıcılar için sistem, tanımlanmış özel söz dağarcığını da dikkate alıyor.
Sistem, kullanıcının konuşma akışını bozmadan metni düzenleyerek daha profesyonel bir çıktı veriyor. Bu durum, bilhassa süratli not alması gereken kullanıcılar için büyük bir kolaylık sağlıyor.
Geniş Dil Desteği ve Kullanım Alanları
Gemini 3.5 Transcribe, dünya genelinde 85 farklı lisanı destekleyerek geniş bir kullanıcı kitlesine hitap ediyor. Evvelce kaydedilmiş ses belgelerinde ise birebir anda üç farklı konuşmacıyı ayırt edebilme yeteneğine sahip.
Modelin sunduğu bu temizleme özellikleri, kısa metin bloklarında hayli başarılı sonuçlar veriyor. Lakin yapay zekanın konuşulan tabirleri teknik olarak değiştirmesi, birtakım durumlar için uygun olmayabilir.
Google, bu modelin sesli giriş tecrübesini daha profesyonel bir düzeye taşımayı amaçladığını belirtiyor. Kullanıcıların sesli komut verirken yaşadığı yazım yanılgıları ve duraksamalar, artık daha az sorun teşkil edecek.
Teknoloji dünyasında sesli girişlerin giderek daha fazla kıymet kazandığı bu periyotta, Google’ın bu atağı değerli bir adım olarak görülüyor. Yazılımın sunduğu bu iyileştirmeler, günlük kullanımda sesli not alma süreçlerini hızlandırabilir.
Yapay zeka dayanaklı bu yeni modelin, bilhassa uzun toplantı notlarının yahut sesli bildirilerin düzenlenmesinde verimliliği artırması bekleniyor. Google, bu teknolojiyle sesli girişlerin metin tabanlı bağlantıdaki yerini güçlendirmeyi hedefliyor.
Sizce yapay zeka tarafından düzenlenen sesli metinler, özgün konuşmanın doğallığını bozuyor mu?
Kaynak: Shiftdelete