Benchmark
Un test standard, la fel pentru toți, cu care se compară modelele AI între ele.
E ca un examen național: toate modelele primesc aceleași subiecte, iar rezultatul e un punctaj.
Un benchmark măsoară un singur lucru — programare, știință, logică. Un model bun la unul poate fi mediocru la altul, așa că niciun clasament nu spune toată povestea.