Pencarian

Android Bench Versi Baru Google Ubah Cara Uji AI Coding, Claude Fable 5 Puncaki Peringkat

Kamis, 09 Juli 2026 • 01:11:21 WIB
Android Bench Versi Baru Google Ubah Cara Uji AI Coding, Claude Fable 5 Puncaki Peringkat
Google perbarui Android Bench dengan framework Harbor untuk evaluasi AI coding Android.

SUMATERA UTARA — Google mengumumkan perubahan signifikan pada sistem peringkat "Android Bench" yang diluncurkan awal tahun ini. Platform yang tadinya menjadi tolok ukur kemampuan model AI dalam menulis kode untuk Android kini menggunakan framework standar Harbor sebagai pengganti alat benchmark mini-swe-agent v1 yang digunakan sebelumnya.

Apa yang Berubah dari Sistem Pengujian AI untuk Android?

Peralihan ke framework Harbor bukan sekadar ganti nama. Menurut Google, langkah ini memungkinkan developer Android menggunakan alat yang sama untuk menganalisis model AI sesuai kebutuhan spesifik mereka. Sebelumnya, model seperti GPT-5.5, Claude Opus 4.7, dan Gemini 3.1 Pro Preview dievaluasi dengan alat benchmark yang dikembangkan untuk penggunaan umum.

"Dari awal, kami menghargai pendekatan yang terbuka dan transparan, itulah sebabnya kami membuat metodologi asli dan alat uji kami tersedia untuk publik di GitHub," tulis Google dalam pengumuman resmi.

Google juga mengundang komunitas developer untuk berpartisipasi langsung. Pengguna kini bisa mengirimkan tugas pengembangan Android yang akan digunakan untuk mengevaluasi cara model AI menangani setiap skenario. Developer juga dipersilakan membagikan hasil evaluasi benchmark mereka sendiri.

Skor Terbaru Android Bench: Claude Fable 5 Kokoh di Puncak

Setelah semua model diuji ulang dengan framework baru—baik varian closed-weight maupun open-weight—Claude Fable 5 buatan Anthropic keluar sebagai pemimpin dengan skor 84,5. Pencapaian ini menegaskan klaim performa tinggi yang sebelumnya disampaikan Anthropic, meskipun model tersebut masih memiliki batasan penggunaan yang ketat.

Berikut peringkat lengkap Android Bench versi terbaru:

  • Claude Fable 5 — 84,5
  • GPT-5.5 — 80,2
  • Claude Sonnet 5 — sekitar 74,5 (hampir 10 poin di bawah Fable 5)

Skor model-model lain yang sebelumnya masuk daftar Android Bench juga berubah karena aturan pengujian yang mendasarinya berganti total.

Dampak untuk Developer Android di Indonesia

Bagi pengembang aplikasi Android di pasar lokal, perubahan ini berarti mereka bisa mendapatkan gambaran yang lebih akurat tentang model AI mana yang paling cocok untuk kebutuhan coding spesifik mereka. Daripada hanya mengandalkan peringkat umum, developer kini dapat menguji model dengan tugas-tugas yang relevan dengan proyek mereka sendiri.

Google menyebut langkah ini sebagai bentuk kolaborasi yang lebih dalam dengan komunitas developer. "Anda meminta cara untuk memberikan umpan balik pada kumpulan data kami, jadi sekarang kami membawa kolaborasi selangkah lebih jauh dengan memberi Anda, komunitas developer Android, kesempatan untuk membentuk Android Bench," demikian pernyataan Google.

Dengan sistem baru ini, kompetisi antar model AI untuk coding Android dipastikan akan semakin ketat. Fable 5 memimpin untuk saat ini, tapi celah skor yang tipis dengan pesaing utama menunjukkan persaingan masih terbuka lebar.

Bagikan
Sumber: 9to5google.com

This article was automatically rewritten by AI based on the source above without altering the facts of the original article.

Berita Lainnya

Indeks

Pilihan

Indeks

Berita Terkini

Indeks