Net „Pokémon“ nėra apsaugotas nuo ginčų dėl AI lyginamosios analizės.

Praėjusią savaitę „X“ įrašas tapo virusinis, teigdamas, kad naujausias „Google“ „Gemini“ modelis pranoko „Anthropic“ flagmano „Claude“ modelį originaliame „Pokémon“ vaizdo žaidimo trilogijoje. Pranešama, kad Dvyniai buvo pasiekę Lavendaro miestą kūrėjo „Twitch“ sraute; Claude’as buvo įstrigęs prie Mėnulio kalno nuo vasario pabaigos.

Tačiau įraše nepavyko paminėti, kad Dvyniai turėjo pranašumą.

Kaip pabrėžė „Reddit“ vartotojai, kūrėjas, palaikantis „Dvynių srautą“, sukūrė pasirinktinį minimapą, kuris padeda modeliui atpažinti „plyteles“ žaidime, pavyzdžiui, supjaustomus medžius. Tai sumažina „Dvynių“ poreikį analizuoti ekrano kopijas, prieš priimant žaidimo sprendimus.

Dabar „Pokémon“ yra geriausiu atveju pusiau rimtas AI etalonas-nedaugelis teigia, kad tai labai informatyvus modelio galimybių išbandymas. Bet tai yra Patobulintas pavyzdys, kaip skirtingi etalono įgyvendinimai gali paveikti rezultatus.

Pavyzdžiui, „Anthropic“ pranešė apie du savo naujausio „Anthropic 3.7 Sonnet“ modelio, patvirtinto „SWE-Bench“, patvirtintą, skirtą modelio kodavimo gebėjimams įvertinti. „Claude 3.7 Sonet“ pasiekė 62,3% tikslumą, patikrintą SWE-Bench, tačiau 70,3% su „pasirinktiniais pastoliais“, kuriuos sukūrė „Anthropic“.

Visai neseniai „Meta“ patobulino vieno iš naujesnių modelių „Lla 4 Maverick“ versiją, kad gerai atliktų tam tikrą etaloną, LM areną. Tuo pačiu vertinimu vanilinė modelio versija žymiai blogiau.

Atsižvelgiant į tai, kad AI etalonai, įskaitant „Pokémon“, yra netobulos priemonės, kurias reikia pradėti, pritaikyti ir nestandartiniai įgyvendinimai kelia grėsmę dar labiau purvinant vandenis. Tai yra, neatrodo, kad būtų lengviau palyginti modelius, kai jie bus išleisti.





Source link