5 Fordele ved ChatGPT o3-mini over andre AI-modeller

5 Fordele ved ChatGPT o3-mini over andre AI-modeller

Openai lancerede endelig sin Frontier O3-mini-model som svar på Kinas Deepseek R1-resonnementsmodel denne weekend. O3-serien af ​​modeller blev annonceret i december sidste år. Openai spildte ikke tid og lancerede O3-mini og O3-mini-høj for at holde sin føring i AI-løbet. Så vi var nysgerrige efter alle de ting, Chatgpt O3-Mini gør bedre end andre AI-modeller, og ja, vi testede det ud. Vi har testet dens kodende dygtighed og diskuteret forskellige benchmarks nøje. Lad os dykke ind på den note.

1. ekstraordinær kodningsydelse

Openai siger, at O3-mini leverer enestående ydelse i kodningsopgaver, mens omkostningerne er lave og opretholder stor hastighed. Før O3-mini-modellen var Anthropic’s Claude 3.5 Sonnet Go-to-modellen til programmeringsforespørgsler. Men det ændrer sig med O3-mini-udgivelsen, specifikt med den O3-mini-høje model, der er tilgængelig for ChatGpt Plus og Pro-brugere.

Jeg testede O3-mini-høj model Og bad det om at skabe et Python -slange -spil, hvor flere autonome slanger konkurrerer med hinanden. Den O3-mini-høje model tænkte i 1 minut og 10 sekunder og genererede Python-koden i et skud.

Jeg udførte koden, og den løb glat uden problemer. Det var sjovt at se autonome slanger gøre deres bevægelser, og det var helt præcist, ligesom mennesker spiller!

autonomt slange spil udviklet af O3 mini

Når alt kommer til alt har O3-Mini-High-modellen opnået en ELO-score på 2.130 på Codforces konkurrencedygtige programmeringsplatform. Dette sætter den O3-mini-høje model blandt de 2500 bedste programmerere i verden. Bortset fra det, i SWE-Bench-verificeret benchmark, der evaluerer kapaciteter til løsning af softwareproblemer i den virkelige verden, opnåede O3-Mini-High 49,3% nøjagtighed, hvilket er Endnu højere end den større O1 -model (48,9%).

Læs også:

Hvad er markør AI, Chatgpt -udskiftningen til kodning

Så til AI-kodningshjælp tror jeg, at den O3-mini-høje model vil tilbyde dig den bedste ydelse, indtil den fulde O3-model kommer ud, som Sam Altman siger, kommer om et par uger.

2. Spørg udfordrende matematikproblemer

Bortset fra kodning er matematik en anden disciplin, hvor O3-mini-modellen overgår andre AI-modeller. I den prestigefyldte 2024 American Invitational Mathematics Examination (AIME), der har spørgsmål fra antal teori, sandsynlighed, algebra, geometri osv., Opnåede O3-mini-højen en imponerende 87,3% igen, højere end den fulde O1-model.

O3 mini aime 2024 benchmark

I den strenge frontiermath-benchmark, der indeholder matematikproblemer på ekspertniveau fra førende matematikere, feltermedaljer og professorer fra hele verden, opnåede O3-mini-høje 20% efter otte forsøg. Selv i et enkelt forsøg scorede det 9,2%, hvilket stadig er betydningsfuldt.

Læs også:

Chatgpt O1 vs Deepseek R1: Battle of Frontier AI -modeller

For at sætte dette i perspektiv har den anerkendte matematiker Terence Tao beskrevet problemerne i Benchmark i Frontiermath som ”ekstremt udfordrende”. Det kan tage timer og dage at løse dem, selv for ekspert matematikere. Andre ChatGPT -alternativer har kun formået at opnå kun 2% i dette benchmark.

3. din videnskabsekspert på ph.d.-niveau

Den O3-mini-høje model udmærker sig også på videnskabsspørgsmål på ph.d.-niveau og slår andre AI-modeller med en betydelig margin. GPQA Diamond er et avanceret benchmark, der evaluerer kapaciteterne for AI -modeller inden for specialiserede videnskabelige domæner. Det består af avancerede spørgsmål fra områderne biologi, fysik og kemi.

O3 mini gpqa diamant benchmark

I GPQA Diamond Benchmark scorede O3-mini-høje en bemærkelsesværdig 79,7%og overgik den større O1-model (78,0%). Til sammenligning kunne Googles seneste Gemini 2.0 Flash Thinking (EXP-01-21) ræsonnementsmodel administrere 73,3%. Selv den nye Claude 3.5 Sonnet -model ligger på 65% i GPQA Diamond Benchmark.

Det viser, at Openais mindre O3-mini-model, når den får mere tid og beregner til at tænke, kan overgå andre AI-modeller på videnskabsspørgsmål på ekspertniveau.

4. generel viden

På tværs af generelle videndomæner forventes det, at O3-mini ikke ville slå større modeller, da det er mindre og specialiseret til kodning, matematik og videnskab. På trods af sin mindre størrelse kommer den meget tæt på at matche større modeller. I MMLU-benchmark, der vurderer ydelsen af ​​AI-modeller på tværs af en lang række emner, får O3-mini-høje score 86,9%, hvorimod Openais egen GPT-4O-model får 88,7%.

O3 mini mmlu benchmark

Når det er sagt, ville den kommende større O3 -model let slå alle AI -modeller derude på tværs af generelle videndomæner. Jeg siger dette, fordi den fulde O1 -model allerede opnåede 92,3% på MMLU -benchmark. Nu er vi nødt til at vente på den fulde O3 -model, der kan mætte benchmark helt.

Læs også:

6 seje ting chatgpt 4o kan gøre, at openai ikke fremhæver

5. O3-mini med websøgning

Brug af O3 Mini med websøgning

Videnafbrydelsen af ​​O3-mini er oktober 2024, som er ret gammel på dette tidspunkt. Imidlertid har Openai tilføjet websøgningsstøtte til O3-mini-modellen, hvilket giver begrundelsesmodellen mulighed for at udtrække de nyeste oplysninger fra Internettet og udføre avanceret ræsonnement. Deepseek R1 gør også dette, men ingen anden ræsonnementsmodel giver dig mulighed for at få adgang til internettet for yderligere ræsonnement.

Så dette er nogle af de avancerede kapaciteter i O3-mini-modellen. Mens gratis chatgpt-brugere også kan få adgang til O3-mini, Ræsonnementsindsats er indstillet til “Medium” som bruger mindre beregning.

Jeg vil anbefale at betale for ChatGpt Plus-abonnementet, der koster $ 20/måned, for at låse den kraftfulde ‘O3-mini-høje’ model op. For professionelle kodere, forskere og studerende i stammen kan den O3-mini-høje model være meget gavnlig.

Støt vores arbejde ❤️

Hvis du kunne lide denne artikel, kan du overveje at give drikkepenge for at hjælpe os med fortsat at udgive kvalitetsindhold.

Sikker betaling med PayPal
Moyens I/O Staff har motiveret dig og givet dig råd om teknologi, personlig udvikling, livsstil og strategier, der vil hjælpe dig.