Google og Openai konkurrerer head-to-head om at levere den bedste indfødte billedgenereringsmodel. Efter at Google introducerede indfødte billedgenerering i Gemini, spildte Openai ikke tid og Tilføjet support til indbygget billedoutput For alle ChatGpt -brugere. Så for at finde ud af, hvilken AI -model leverer bedre resultater, har jeg sammenlignet indfødte billedgenerering i Openais Chatgpt og Google Gemini. Jeg har testet modellerne for karakterkonsistens, tekst gengivelse, instruktionsadhæsion og mere i dette indlæg.
1. gør dig selv til en anime -karakter
Jeg startede sammenligningen af indfødte billedgenerering mellem Chatgpt og Gemini ved at bede begge modeller om at skabe et anime-stil billede. Som du kan se i resultaterne herunder, ramte Chatgpt 4o det ud af parken og genererede billedet i klassisk Studio Ghibli -stil på én gang. På den anden side prøvede jeg flere anmodninger om Gemini, men den oprindelige billedgenereringsmodel kunne overhovedet ikke skabe et anime-stil billede.

2. tavle -session
I den næste test bad jeg Chatgpt og Gemini om at oprette et billede, der viser En mand, der forklarer begrebet relativitet. Takket være den større ChatGpt 4o -model producerede Chatgpt et fantastisk billede med læselig håndskrevet tekst. Det fangede endda fotografen i refleksionen.
Den mindre Gemini 2.0 -flashmodel kæmpede for at få teksten Lige på tavlen. Mens Gemini med succes tilføjede “Moyens I/O” til mandens T-shirt, fangede den ikke fotografens refleksion. Når det er sagt, ser manden i Geminis output mere autentisk ud sammenlignet med Chatgpts output.


3. tekst gengivelse i et menukort
Dette er det bedste eksempel til at vise forskellen mellem Chatgpt og Gemini i indfødte billedgenerering. Chatgpt designet et smukt menukort med perfekt tekst gengivelse. Det gik glip af den sidste skål, men det fulgte mine instruktioner temmelig godt. Når det er sagt, Gemini begynder at hallucinere Hvis du kaster tæt information i din promp. Det har næsten al teksten forkert med virvlede ord.


4. Opret en infographic
Derefter bad jeg Chatgpt og Gemini om Opret en infographic At forklare begrebet tyngdekraft med Newton som karakter. Det siger sig selv, at Chatgpt gjorde et pragtfuldt job, både hvad angår design og forklaring af konceptet i klar, læsbar tekst.
Resultatet er så godt, at Chatgpts funktion i oprindelige billedgenerering kan bruges til Opret tegneserier, uddannelsesbøger, visuelle guider og mere.
Geminis oprindelige billedgenfunktion kan gå ud over at fjerne vandmærker
På den anden side har Gemini været skuffende over sit resultat. Teksten og visualerne giver ingen mening. En ting at bemærke er, at Gemini 2.0 -flash genererer et billede Inden for 3 til 4 sekundermens ChatGpt tager mere end et minut at fremstille et enkelt billede. Chatgpt bruger den større 4o -model, der bruger en masse behandlingskraft, hvilket fører til et langt mere sammenhængende resultat.


5. Restyle -billeder
Kommer til Restyling -billeder, jeg Uploadet et billede af en kaktusplante I en have og fik begge modeller til at tilføje nogle farverige blomster. I min test fandt jeg, at Chatgpt går over bord med hver forfining. Det ændrede helt udseendet på billedet efter hver ændring. I modsætning hertil opretholdt Gemini -modellen konsistensen på tværs af flere generationer.
Mens Chatgpt 4o er naturligt multimodal (bygget på en auto-regressiv arkitektur), nogle Eksperter Tro, at den indfødte billedgenerationsfunktion bruger en diffusionsbaseret dekoder. Selvom det hjælper med nøjagtigt at gengive tekst, regenererer det også billedet på hver iteration.
Så det er det Ikke en ren auto-regressiv model Ligesom Gemini 2.0 -flash, dermed, forskellen i billedoutput efter hver ændring.



6. Bland billeder sammen
Dernæst uploadede jeg to billeder og bad Chatgpt og Gemini begge om at skabe et billede af kvinden, der holder kruset. Begge modeller leverede imponerende resultater. Faktisk var Gemini lidt mere kreativ og ændrede også holdningen. Når det er sagt, siger Openai, at Chatgpt 4o kan håndtere op til 20 billeder i en hurtig og udnytte i-kontekst-læring for at skabe et enkelt, samlet billede.



7. Skift synspunkt
I den næste test uploadede jeg et billede af en gang og fik Chatgpt og Gemini til at ændre synspunktet. Begge modeller leverede næsten lignende resultater, men Chatgpt var tættere på det originale billede. Gemini hallucinerede og tilføjede et ekstra ben til lænestolen. Generelt vil jeg give denne runde til Chatgpt, da den spejlede den modsatte opfattelse mere præcist.



8. Et vægur, der viser 6:30 gang
Endelig, i den sidste test, undlod både Chatgpt og Gemini sig at gengive den specificerede tid (6:30) på væggen. Det er et tilbagevendende problem i AI -billedgenerering, da modeller har en tendens til Standard til 10:10 på grund af forspændinger I træningsdatasættet. Så selv med indfødte billedgenerering har Openai og Google ikke været i stand til at overvinde denne begrænsning i instruktion efter.


Konklusion: Chatgpt vs Gemini Native Image Generation
Efter at have kørt en række tests, kan jeg med sikkerhed sige det Chatgpts oprindelige billedgenerering er i øjeblikket mere avanceret end Gemini 2.0 Flash. Det drives af den større ChatGpt 4o -model, der har bredere verdenskendskab. Dette resulterer i flere sammenhængende billeder. Det giver perfekt tekst og følger instruktioner med imponerende præcision.
I modsætning hertil Eksperimentel Gemini 2.0 -flashmodel er mindrehvilket resulterer i hurtigere ydeevne. Imidlertid hallucinerer det ofte, mens den gengiver tæt tekst, og resultaterne er af lavere kvalitet.
Det, der får Gemini til at skille sig ud, er, at det opretholder konsistensen efter hver generation, hvilket er en stor fordel. Vi bør vente på native outputstøtte til den nyligt frigivne Gemini 2.5 Pro-model, som forventes at levere enestående ydelse i indfødte billedgenerering.
Støt vores arbejde ❤️
Hvis du kunne lide denne artikel, kan du overveje at give drikkepenge for at hjælpe os med fortsat at udgive kvalitetsindhold.



















