Google, sesli yapay zeka ajanlarında gecikmeleri azaltmaya odaklanan Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modellerini tanıttı. Yeni modeller, kullanıcıyla sohbet ederken arka planda araç ve API çağrıları gerçekleştirerek görevlerin tamamlanması sırasında konuşmanın devam etmesini sağlıyor. Google bu yaklaşımla daha doğal bir sesli iletişim deneyimi sunmayı hedefliyor.
Google’ın açıklamasına göre, standart Gemini 3.8 Live ölçeklenebilirlik ve maliyet verimliliğine odaklanırken, Extended Thinking daha karmaşık görevler ve çok adımlı akıl yürütme için geliştirildi. Bu sürüm, konuşmayla akıl yürütmeyi eş zamanlı sürdürebiliyor ve arka plandaki işlemlerin ilerleyişini kullanıcıya sözlü olarak aktarabiliyor.
Modeller, 97 dilde konuşmayı anlama ve ses üretme desteği sunuyor. Kullanılan dili otomatik algılayıp sohbet sırasında diller arasında geçiş yapabiliyor. Görsel girdileri de gerçek zamana yakın biçimde işleyerek yanıtlarını bu bilgilerle destekleyebiliyor.
Google’ın paylaştığı demolar, bu yeteneklerin kullanım alanlarını da gösteriyor. Standart model, görsel bağlamdan yararlanarak çalışanların işe uyum sürecindeki sorularını yanıtlayabiliyor ve satranç oynayabiliyor. Extended Thinking ise taslak çizimleri ve anlık sesli geri bildirimleri çalışan React bileşenlerine dönüştürebiliyor. Birden fazla aşama gerektiren rezervasyon işlemlerini konuşmayı sürdürerek yönetmesi de örnekler arasında yer alıyor.
Şirketin paylaştığı sonuçlara göre Extended Thinking, Artificial Analysis’in Speech to Speech Quality Index değerlendirmesinde 82,6 puanla GPT-Live-1-Astra ve Grok Voice Think Fast 2.0’ı geride bıraktı. Standart model ise Speech Agent Arena’da ikinci sırada yer aldı.
Her iki model de Gemini API ve Google AI Studio üzerinden kullanıma sunulmaya başladı. Kurumsal tarafta Gemini Enterprise’da özel ön izleme kapsamında erişilebiliyor. Standart model Search Live’a, Extended Thinking ise Gemini Live’a geliyor. Extended Thinking’in Workspace erişimi Docs’ta Google AI Pro ve Ultra abonelerini, Gmail ve Keep’te ise tüm Google AI abonelerini kapsıyor. Üretilen seslere, yapay zeka içeriğinin tespitini sağlayan SynthID filigranı ekleniyor.
Fiyatlandırmada standart modelin ses girdisi dakika başına 0,005 dolar, ses çıktısı ise 0,018 dolar olarak açıklandı. Extended Thinking sürümünde akıl yürütme token’ları ile video ve belge gibi ek girdiler ayrıca ücretlendiriliyor.
İlk Yorumu yazmak ister misiniz?
İlk Yorumu yazmak ister misiniz?












































İlk Yorumu yazmak ister misiniz?
Yorum Yazmak için Giriş Yap