Nvidia, der bygger nogle af de mest eftertragtede GPU’er i AI-industrien, har meddelt at det har udgivet en open source stor sprogmodel, der efter sigende yder på niveau med førende proprietære modeller fra OpenAI, Anthropic, Meta og Google.
Virksomheden introducerede sin nye NVLM 1.0-familie i en nyligt udgivet hvidbogog den er ført i spidsen af NVLM-D-72B-modellen med 72 milliarder parametre. “Vi introducerer NVLM 1.0, en familie af grænseoverskridende multimodale store sprogmodeller, der opnår avancerede resultater på vision-sprogopgaver, der konkurrerer med de førende proprietære modeller (f.eks. GPT-4o) og modeller med åben adgang, ” skrev forskerne.
Introduktion af NVLM 1.0, en familie af grænseoverskridende multimodale LLM’er, der opnår avancerede resultater på vision-sprogopgaver, der konkurrerer med de førende proprietære modeller (f.eks. GPT-4o) og modeller med åben adgang (f.eks. InternVL 2 ).
Bemærkelsesværdigt viser NVLM 1.0 forbedret kun tekst… pic.twitter.com/yKGyOqHnsp
— Wei Ping (@_weiping) 18. september 2024

Få din ugentlige nedtagning af teknologien bag pc-spil
Den nye modelfamilie er efter sigende allerede i stand til “produktionsgrad multimodalitet”, med enestående ydeevne på tværs af en række forskellige syns- og sprogopgaver, foruden forbedrede tekstbaserede svar sammenlignet med den grundlæggende LLM, som NVLM-familien er baseret på. “For at opnå dette laver og integrerer vi et datasæt af høj kvalitet kun til tekst i multimodal træning sammen med en betydelig mængde multimodal matematik og ræsonnement data, hvilket fører til forbedrede matematik- og kodningsmuligheder på tværs af modaliteter,” forklarede forskerne.
Resultatet er en LLM, der lige så nemt kan forklare, hvorfor en meme er sjov, som den kan løse komplekse matematiske ligninger trin for trin. Nvidia formåede også at øge modellens kun tekstnøjagtighed med et gennemsnit på 4,3 point på tværs af almindelige industribenchmarks, takket være dens multimodale træningsstil.

Nvidia ser ud til at være seriøs med at sikre, at denne model opfylder Open Source Initiatives nyeste definition af “open source” ved ikke kun at gøre dets træningsvægte tilgængelige for offentlig gennemgang, men også ved at love at frigive modellens kildekode i den nærmeste fremtid. Dette er en markant afvigelse fra handlinger fra rivaler som OpenAI og Google, som nidkært vogter detaljerne i deres LLM’ers vægt og kildekode. Ved at gøre det har Nvidia positioneret NVLM-familien til ikke nødvendigvis at konkurrere direkte mod ChatGPT-4o og Gemini 1.5 Pro, men snarere tjene som et fundament for tredjepartsudviklere til at bygge deres egne chatbots og AI-applikationer.
Støt vores arbejde ❤️
Hvis du kunne lide denne artikel, kan du overveje at give drikkepenge for at hjælpe os med fortsat at udgive kvalitetsindhold.




















