Studie afslører AI's overhypede kapaciteter: Er benchmarks misvisende?

Studie afslører AI’s overhypede kapaciteter: Er benchmarks misvisende?

Har du bemærket al snakken om kunstige intelligensmodeller, der klarer advokateksamen eller når Ph.D.-niveau? Det kan være tid til at tage et nærmere kig, for en nylig undersøgelse fra Oxford Internet Institute indikerer, at mange benchmarkværktøjer, der bruges til at vurdere AI-ydeevne, måske ikke er så pålidelige, som vi troede.

Forskere har evalueret 445 forskellige benchmark-tests, der anvendes i industrien og akademia, med fokus på forskellige færdigheder, fra resoneringskapaciteter til kodepræstation. De fandt, at vurderingerne ofte misrepræsenterer AI’s kapaciteter på grund af vage definitioner af, hvad en benchmark har til hensigt at måle, og utilstrækkelig oplysning om statistiske metoder til effektivt at sammenligne modeller.

1. Udfordringen med validitet i AI-benchmarks

Et væsentligt problem identificeret i denneundersøgelse er, at mange benchmarks ikke giver gyldige målinger af deres tilsigtede mål. Essentielt kan en benchmark påstå at vurdere en specifik færdighed, men kan gøre det på en måde, der ikke virkelig fanger en models kapaciteter.

2. Casestudie: Grade School Math 8K

Tag for eksempel Grade School Math 8K (GSM8K) testen. Denne benchmark har til formål at evaluere en models præstation på ordbaserede matematikopgaver, der fremmer “flerskridts matematisk ræsonnering”. Forskere mener imidlertid, at det at score godt på GSM8K ikke nødvendigvis indikerer ægte ræsonneringsevne.

“Når du spørger en første klasses elev, hvad to plus fem er, og de siger syv, ja, det er korrekt. Men kan du konkludere, at en femte klasses elev har mestret matematisk ræsonnering kun på baggrund af at lægge tal sammen? Meget sandsynligt nej,” siger Adam Mahdi, en senior forskningsstipendiat ved Oxford Internet Institute.

3. Præstationsmønstre og kontaminationsproblemer

Forskerne bemærkede, at scorerne på GSM8K er forbedret over tid, hvilket tyder på, at AI-modeller muligvis bliver bedre til denne type ræsonnering. Dette kan dog også pege på kontaminering: når testspørgsmål utilsigtet bliver en del af modellens datasæt, hvilket fører til memorisering i stedet for ægte ræsonnering. Når disse modeller blev testet med nye benchmarkspørgsmål, viste de betydelige fald i præstation.

4. Tidligere forskning om AI-benchmarkbegrænsninger

Dette er ikke den første undersøgelse, der sætter spørgsmålstegn ved benchmarktest. Sidste år fandt forskere ved Stanford “store kvalitetsforskelle” blandt populære AI-benchmarks. De bemærkede, at mens de oprindelige design kan være af høj kvalitet, lider den praktiske implementering ofte under mangler.

5. Implikationerne for AI-vurdering

Denne undersøgelse fungerer som en vigtig påmindelse om, at mens benchmarks har til formål at give en nøjagtig evaluering af AI-modeller, kan de undertiden forvandle sig til blot marketingværktøjer for virksomheder. Det er essentielt at tilgå disse vurderinger med kritiske øjne.

Er AI-benchmarks pålidelige nok til at vurdere modelkapaciteter? Dette er et vigtigt spørgsmål. Som vi har set, afspejler mange benchmarks måske ikke nøjagtigt en models præstation, hvilket fører til overdrevent indtryk af intelligens. Dette opfordrer os til at stille spørgsmålstegn ved gyldigheden af AI-vurderinger mere grundigt.

Hvad skal vi kigge efter i en effektiv AI-benchmark? En høj kvalitet benchmark bør have klare definitioner og robuste statistiske metoder, der muliggør bedre sammenligning og fortolkning. Søg altid efter benchmarks, der er rapporteret på en gennemsigtig måde.

Hvordan kan vi sikre bedre benchmarking for AI-modeller? At fremme åben samarbejde mellem industri og akademia kan hjælpe med at forfine trænings- og vurderingsmetoder, så vi bedre kan vurdere AI-præstation.

Hvilke branchestandard benchmarks bruges i øjeblikket? Populære benchmarks inkluderer benchmarks som GLUE til naturlig sprogforståelse og COCO til billedbehandling—selvom selv disse har begrænsninger.

Hvad bringer fremtiden for AI-benchmarking? For at forblive relevante skal AI-vurderinger kontinuerligt forbedres og tilpasses, og integrere lærdom fra tidligere forskning og feedback fra samfundet.

Som AI-teknologi udvikler sig, skal vores forståelse af, hvordan man måler den, også gøre det. Det er afgørende at tilgå AI-vurderinger med et kritisk øje. Hvis du er ivrig efter at dykke dybere ned i nuancerne af AI-teknologi, så overvej at tjekke ressourcer på Moyens I/O for yderligere indsigter.

Støt vores arbejde ❤️

Hvis du kunne lide denne artikel, kan du overveje at give drikkepenge for at hjælpe os med fortsat at udgive kvalitetsindhold.

Sikker betaling med PayPal