Google Gemini 2.5 Ultra slår GPT-5 på matematikk og kode
Google annonserte Gemini 2.5 Ultra med toppplassering på MATH-500 og HumanEval. For første gang siden GPT-4 er ikke OpenAI-modellen best på den mest brukte kode-benchmarken.
Google har slΓ₯tt tilbake. Gemini 2.5 Ultra ble annonsert i juli 2026 med to benchmark-seire som hele AI-bransjen merket seg:
- MATH-500: Gemini 2.5 Ultra lΓΈste 96,8% av oppgavene korrekt β mot GPT-5s 94,1%
- HumanEval (kodegenerering): Gemini 2.5 Ultra lΓΈste 92,4% av oppgavene β mot GPT-5s 89,7%
Hva er disse benchmarkene? MATH-500 er en samling av 500 konkurransematematikk-problemer fra gymnasialt til universitetsnivΓ₯. HumanEval er en samling av 164 Python-kodeutfordringer som tester modellens evne til Γ₯ skrive fungerende programmeringskode.
Er benchmarks det samme som praktisk ytelse? Nei β og det er den viktige nyanseringen. En modell kan toppe benchmarks og likevel skuffe i daglig bruk. Men matematikk og kode er de mest objektive mΓ₯lene vi har, fordi svarene er enten riktige eller gale.
Hva betyr det for brukere? For bedrifter som bruker AI til dataanalyse, formelbygging, kode-review eller teknisk dokumentasjon, er dette det sterkeste argumentet sΓ₯ langt for Γ₯ vurdere Gemini 2.5 Ultra.
En viktig begrensning: Ultra-varianten er dyr β kun tilgjengelig for bedriftsabonnementer til en pris som overstiger bΓ₯de Claude 4 Opus og GPT-5 Opus. Den er ikke for alle.
For norske bedrifter med tunge analytiske oppgaver eller sofistikert Excel/Python-bruk er det verdt Γ₯ teste Ultra mot din konkrete arbeidsflyt.