
Android Bench 2.0 abandonează testele simple în favoarea unei evaluări în care modelele AI trebuie să îndeplinească sarcini complexe ce durează zile, precum dezvoltarea aplicațiilor, migrarea bibliotecilor și conversia aplicațiilor cross-platform.
Sistemul folosește un punctaj continuu, evaluând funcționalitatea, fidelitatea vizuală și corectitudinea arhitecturii codului, penalizând orice abatere, ceea ce oferă o privire detaliată asupra progreselor făcute de modelele AI.
Rezultatele indică că, deși modelele se descurcă bine cu transformări simple și noi funcționalități, sarcinile arhitecturale și portarea aplicațiilor rămân dificile, iar integrarea AI cu sculele de dezvoltare influențează semnificativ performanța generală.