Google ha presentado la segunda versión de Android Bench, un benchmark pensado para medir el rendimiento de los modelos de IA en el desarrollo para Android. La compañía ha señalado que las nuevas pruebas son más precisas y se centran en mayor medida en tareas complejas, esas que a una persona le llevan varios días.
La principal diferencia del benchmark renovado es una evaluación más detallada de la resolución de la tarea (Pass Rate). Ahora el sistema puntúa al modelo de IA por varias categorías, como la funcionalidad del software creado, y puede dar una tarea por resuelta en parte aunque la red neuronal no la haya completado del todo. Antes la evaluación era binaria: o el modelo la resolvía por completo o no recibía ningún punto.
La compañía también ha mostrado cómo se comportan los modelos actuales en el benchmark renovado. El liderato es para GPT-6 Astra, con un Pass Rate del 28%. Le siguen Claude Fable 5.1 y GPT-5.6 Sol.
El ranking actualizado de redes neuronales en Android Bench 2 puede consultarse en la web oficial.