Gemini 3.5 Transcribe: AI Speech-to-Text 70% Lebih Cepat dari Chirp 3

Jumali
Jumali Kamis, 27 Agustus 2026 20:37 WIB
Gemini 3.5 Transcribe: AI Speech-to-Text 70% Lebih Cepat dari Chirp 3

Gemini 3.5 Transcribe- ist/Google

Harianjogja.com, JOGJA— Google resmi merilis model kecerdasan buatan (AI) terbaru bernama Gemini 3.5 Transcribe, sebuah terobosan di bidang teknologi pengenalan suara. Berbeda dari teknologi speech-to-text konvensional yang hanya menyalin ucapan secara mentah, Gemini 3.5 Transcribe diklaim dapat memahami inti pembicaraan dan menghasilkan transkripsi yang jauh lebih rapi. Inovasi ini menjadi langkah besar Google dalam menghadirkan AI yang tidak hanya mendengar, tetapi juga mengerti konteks percakapan.

Model AI ini bahkan diklaim bisa menghilangkan kata-kata pengisi seperti "ehm" atau "eee" yang biasanya muncul ketika seseorang berbicara. Fitur ini sangat berguna untuk menghasilkan transkripsi yang bersih dan profesional, terutama untuk keperluan rapat, wawancara, atau pembuatan konten. Dengan menghilangkan kata-kata pengisi, hasil transkripsi menjadi lebih mudah dibaca dan dipahami tanpa kehilangan esensi pembicaraan.

Kecepatan dan Akurasi yang Lebih Baik

Google mengatakan model baru ini memiliki kecepatan dan akurasi yang lebih baik dibandingkan model speech-to-text sebelumnya, Chirp 3. Gemini 3.5 Transcribe mampu memproses suara menjadi teks akhir sekitar 70 persen lebih cepat dibandingkan Chirp 3. Peningkatan kecepatan ini menjadi kabar baik bagi para profesional yang membutuhkan transkripsi cepat, seperti jurnalis, peneliti, dan content creator.

Model tersebut juga memiliki tingkat kesalahan sebesar 5,5 persen pada percakapan langsung (live speech). Angka itu lebih rendah dibandingkan Chirp 3 yang memiliki tingkat kesalahan 7,32 persen berdasarkan pengukuran Google. Penurunan tingkat kesalahan ini berarti pengguna dapat lebih mengandalkan Gemini 3.5 Transcribe untuk menghasilkan transkripsi yang akurat, bahkan dalam situasi percakapan yang dinamis dan penuh dengan variasi aksen serta kecepatan bicara.

Fitur Penyuntingan Langsung dan Kosakata Khusus

Selain mentranskripsi ucapan, Gemini 3.5 Transcribe juga dapat melakukan penyuntingan secara langsung ketika pengguna mengoreksi perkataannya. Fitur ini memungkinkan pengguna untuk memperbaiki kesalahan transkripsi secara real-time, sehingga hasil akhir yang dihasilkan lebih akurat dan sesuai dengan keinginan pengguna. Model ini juga mendukung penggunaan kosakata khusus yang ditentukan pengguna. Fitur tersebut dapat membantu ketika transkripsi berisi istilah teknis atau jargon tertentu, seperti dalam bidang kedokteran, hukum, atau teknologi.

Dukungan 85 Bahasa dan Multi-Pembicara

Google mengatakan Gemini 3.5 Transcribe mendukung 85 bahasa dan dapat mengenali percakapan yang melibatkan hingga tiga pembicara dalam satu rekaman audio. Dukungan bahasa yang luas ini menjadikan Gemini 3.5 Transcribe sebagai alat yang sangat berguna bagi pengguna dari berbagai negara dan latar belakang. Kemampuan mengenali hingga tiga pembicara juga sangat bermanfaat untuk transkripsi wawancara atau diskusi kelompok.

Sudah Dipakai di Gboard dan Perluasan Akses

AI Gemini 3.5 Transcribe saat ini sudah digunakan pada fitur Rambler di aplikasi keyboard Gboard. Namun, fitur tersebut baru tersedia pada perangkat Pixel 11. Google berencana memperluas ketersediaan Rambler ke lebih banyak perangkat yang dilengkapi kemampuan Gemini pada akhir tahun ini. Selain itu, pengguna aplikasi Gemini di macOS juga mulai mendapatkan manfaat dari model Gemini 3.5 Transcribe untuk input suara.

Akses untuk Pengembang dan Rencana Masa Depan

Google juga membuka akses Gemini 3.5 Transcribe bagi pengembang melalui sejumlah layanan. Model tersebut mulai tersedia di Antigravity dan AI Studio. Pengembang juga dapat mengaksesnya melalui Gemini API untuk memasukkan kemampuan voice-to-text berbasis AI ke dalam aplikasi mereka. Langkah ini membuka peluang bagi pengembang untuk menciptakan berbagai aplikasi inovatif yang memanfaatkan teknologi transkripsi canggih ini.

Ke depan, Google berencana membawa kemampuan transkripsi tersebut ke peramban Chrome. Integrasi ini memungkinkan pengguna untuk memanfaatkan input suara untuk mengisi berbagai kolom teks di web, seperti menulis e-mail, komentar, atau memberikan perintah kepada chatbot AI. Jika terwujud, fitur ini akan mengubah cara kita berinteraksi dengan internet, membuat pengalaman browsing menjadi lebih cepat dan praktis.

Potensi bagi Pengguna di Indonesia

Bagi pengguna di Indonesia, hadirnya Gemini 3.5 Transcribe membawa angin segar. Dengan dukungan bahasa Indonesia (termasuk dalam 85 bahasa yang didukung), pengguna Tanah Air dapat memanfaatkan teknologi ini untuk berbagai keperluan, mulai dari transkripsi rapat, pembuatan subtitle video, hingga menulis konten dengan lebih cepat dan efisien. Keakuratan dan kecepatan yang ditawarkan oleh model ini berpotensi meningkatkan produktivitas di berbagai sektor, termasuk pendidikan, bisnis, dan media.

 

Cek Berita dan Artikel yang lain di Harian Jogja, dan edisi cetak versi elektronik kami hadir di Epaper Harian Jogja.

Share

Jumali
Jumali Jurnalis Harian Jogja, bagian dari Bisnis Indonesia Group menulis untuk media cetak dan online