Meta Under Fire for Manipulerende Llama 4 Benchmark: Ikke deres første forbrydelse

Meta Under Fire for Manipulerende Llama 4 Benchmark: Ikke deres første forbrydelse

Meta frigav for nylig sin LLAMA 4-serie af AI-modeller, hvilket gjorde overskrifter for at overgå GPT-4O og Gemini 2.0 Pro i Chatbot Arena (tidligere LMSYS). Virksomheden hævdede, at dens LLAMA 4 Maverick -model – en MOE -model, der kun aktiverer 17 milliarder parametre ud af en massiv 400B i løbet af 128 eksperter – opnåede en imponerende ELO -score på 1.417 på Chatbot Arena Benchmark.

Dette resultat hævede øjenbryn over AI-samfundet, da en relativt mindre MOE-model overgik meget større LLM’er som GPT-4.5 og Grok 3. den usædvanlige ydelse fra en lille model førte til, at mange i AI-samfundet tester modellen uafhængigt. Overraskende stemte den virkelige verdens præstation af Llama 4 Maverick ikke i benchmark-påstande fra meta, især i Kodningsopgaver.

1Point3ACRESet populært forum for kinesere i Nordamerika, en bruger, der hævdede at være en tidligere meta -medarbejder, udsendte et bombeskal. Ifølge indlægget, der er blevet oversat til engelsk på RedditMeta-ledelsen angiveligt blandede ”testsættet af forskellige benchmarks i post-træningsprocessen” for at oppustere benchmark-score og opfylde interne mål.

Meta -medarbejderen fandt praksis uacceptabel og valgte at fratræde. Den tidligere medarbejder bad også teamet om at udelukke deres navn fra LLAMA 4 tekniske rapport. Faktisk hævder brugeren, at den nylige fratræden af ​​Metas leder af AI -forskning, Joelle Pineau, er direkte knyttet til Llama 4 -benchmark -hacking.

Som svar på de voksende beskyldninger delte Ahmad al-Dahle, leder af Metas generative AI-division, en post på x. Han afviste bestemt påstanden om, at Llama 4 blev efteruddannet på testsættene. Al-Dahle skriver:

Vi har også hørt påstande om, at vi trænede på testsæt – det er simpelthen ikke sandt, og det ville vi aldrig gøre. Vores bedste forståelse er, at den variable kvalitet, folk ser, skyldes at skulle stabilisere implementeringer.

Han erkendte den inkonsekvente Llama 4 -præstation på tværs af forskellige platforme. Og opfordrede også AI -samfundet til at give det nogle dage til, at implementeringen blev “opkaldt ind.”

LMSYS reagerer på Lama 4 Benchmark Manipulation beskyldninger

Efter bekymring fra AI Community udsendte LMSYS – organisationen bag Chatbot Arena -leaderboard – en erklæring for at forbedre gennemsigtigheden. LMSYS præciserede, at den indsendte model på Chatbot Arena var “Llama-4-Maverick-03-26-Experimental”. Det var en brugerdefineret variant af modellen, optimeret til menneskelig præference.

LMSYS erkendte, at “stil- og modelresponstone var en vigtig faktor”. Dette kan have givet unødig fordel for den brugerdefinerede Llama 4 Maverick -model. Organisationen indrømmede også, at disse oplysninger ikke blev gjort tilstrækkeligt klare af Meta -teamet. Derudover sagde LMSYS, “Metas fortolkning af vores politik stemte ikke overens med, hvad vi forventer af modeludbydere.”

Læs også:

10 bedste store sprogmodeller (LLMS) i 2025

At være retfærdig, meta, i sin officielle Llama 4 Blognævnte, at “En eksperimentel chatversion” scorede 1.417 på Chatbot Arena. Men de forklarede ikke noget yderligere.

Endelig, for at forbedre gennemsigtigheden, tilføjede LMSYS den knusende ansigtsversion af Llama 4 Maverick til Chatbot Arena. Derudover har det frigivet over 2.000 head-to-head-kampresultater for offentligheden at gennemgå. Resultaterne inkluderer promp, modelrespons og brugerpræferencer.

Jeg gennemgik Kampresultaterog det var forvirrende at se brugere konsekvent foretrække Llama 4’s ofte forkerte og overdrevent ordrede svar. Dette rejser dybere spørgsmål om at have tillid til samfundsdrevne benchmarks som Chatbot Arena.

Ikke første gang Meta Gaming Benchmarks

Dette er ikke første gang Meta er blevet beskyldt for spil benchmarks gennem dataforurening, dvs. blanding af benchmark -datasæt i træningskorpuset. Tilbage i februar i år delte Susan Zhang – en tidligere Meta AI -forsker, der nu arbejder hos Google Deepmind – en afslørende undersøgelse som svar på et indlæg af Yann Lecun, Meta AIs hovedforsker.

De studere fandt, at over 50% af testprøver fra nøglebenchmarks var til stede i Metas LLAMA 1 -pretraining -data. Papiret siger: ”Især Big Bench Hard, Humaneval, Hellaswag, MMLU, PIQA og Triviaqa viser betydelige kontamineringsniveauer på tværs af begge korpora”.

Nu, midt i de seneste benchmark -hacking -beskyldninger omkring Llama 4, har Zhang sarkastisk bemærket Denne meta skal i det mindste citere deres “tidligere arbejde” fra Llama 1 for denne “unikke tilgang.” JAB er rettet mod meta om, at benchmark -manipulation ikke er en ulykke. Men det er en strategi fra det Zuckerberg-ledede firma at kunstigt øge præstationsmetrics.

Støt vores arbejde ❤️

Hvis du kunne lide denne artikel, kan du overveje at give drikkepenge for at hjælpe os med fortsat at udgive kvalitetsindhold.

Sikker betaling med PayPal
Moyens I/O Staff har motiveret dig og givet dig råd om teknologi, personlig udvikling, livsstil og strategier, der vil hjælpe dig.