Google cambia le regole per i modelli IA su Android: Fable 5 vola in cima alla classifica

Google cambia le regole per i modelli IA su Android: Fable 5 vola in cima alla classifica


Google ha deciso di rivedere completamente il modo in cui valuta i modelli di intelligenza artificiale per lo sviluppo su Android. Il colosso di Mountain View ha annunciato importanti aggiornamenti per Android Bench, la piattaforma di riferimento che classifica i migliori modelli IA in base alla loro capacità di scrivere codice per il sistema operativo mobile. Una bussola preziosa per gli sviluppatori, che ora potrà contare su criteri più trasparenti e su un nuovo sistema di benchmarking standardizzato.

Segui TuttoAndroid su Google Discover

PubblicitàGrand Theft Auto VI - PS5

Amazon

🎟 Prenota ora la tua copia di GTA 6 su Amazon

79,99€

Come funzionava e cosa cambia

Fino a poco tempo fa, i modelli come GPT-5.5, Claude Opus 4.7 e Gemini 3.1 Pro Preview venivano valutati utilizzando un tool di benchmark chiamato mini-swe-agent v1, sviluppato per un uso generico. Ora, Google ha deciso di passare al framework Harbor, uno standard più aperto e flessibile che permette agli sviluppatori Android di analizzare i modelli IA per casi d’uso specifici, non solo per una classifica generale.

Ma non è finita qui. L’azienda ha aperto le porte alla community: gli sviluppatori possono ora inviare direttamente compiti di sviluppo Android che verranno utilizzati per valutare come i modelli gestiscono scenari reali. E possono anche condividere le proprie valutazioni di benchmark. “Abbiamo sempre creduto in un approccio aperto e trasparente”, si legge nel comunicato di Google, “per questo abbiamo reso pubblico il nostro metodo originale su GitHub. Ora portiamo la collaborazione a un livello superiore, dando alla community di sviluppatori la possibilità di contribuire direttamente ad Android Bench”.

Segui Google su Telegram, ricevi news e offerte per primo

La nuova classifica: Claude Fable 5 in testa

Con il nuovo sistema di valutazione, Google ha aggiornato l’intera classifica di Android Bench, ricalcolando i punteggi di tutti i modelli, sia closed-weight che open-weight. E il risultato è sorprendente: Claude Fable 5 si è piazzato al primo posto con un punteggio di 84,5, staccando di ben 4 punti il secondo classificato, GPT-5.5 (80,2). Più indietro Claude Sonnet 5 con 76,2 e GPT-5.4 con 74,1. La top five si completa con Gemini 3.1 Pro Preview a 73,7.

Ecco la classifica completa dei primi 9 modelli:

Modello Punteggio Latenza media Costo medio
Claude Fable 5 84.5 8.0 $133.2
GPT 5.5 80.2 15.7 $138.3
Claude Sonnet 5 76.2 12.3 $99.9
GPT 5.4 74.1 8.4 $83.4
Gemini 3.1 Pro Preview 73.7 10.6 $87.4
Claude Opus 4.8 72.4 6.7 $88.0
GLM 5.2 72.2 38.9 $117.0
Gemini 3.5 Flash 71.1 28.3 $165.6
Kimi K2.7 Code 70.4 31.8 $48.1

Cosa significa per gli sviluppatori

Il vantaggio di Claude Fable 5 è netto, ma ciò che rende interessante questa nuova classifica non è solo il podio. La vera novità è che ora gli sviluppatori hanno uno strumento più flessibile per valutare i modelli in base alle proprie esigenze, non solo a una metrica generica. Con Harbor e la possibilità di inviare compiti specifici, Android Bench diventa un laboratorio vivente, alimentato dalla community stessa.

Il punteggio di Fable 5, per quanto impressionante, va letto in questo contesto: non è solo una vittoria di Anthropic, ma il segnale che il modo di valutare l’IA per Android sta diventando più trasparente, collaborativo e, soprattutto, utile per chi scrive codice ogni giorno.



Vedi Post Originale: https://www.tuttoandroid.net/news/2026/07/10/android-bench-claude-fable-5-google-cambia-regole-1162106/

Condividi il tuo amore
Tutto Android
Tutto Android
Articoli: 32072

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *