🧠 Modeller Google DeepMind 18. jul 2026

Google Gemini 2.5 Ultra slår GPT-5 på matematikk og kode

Google annonserte Gemini 2.5 Ultra med toppplassering på MATH-500 og HumanEval. For første gang siden GPT-4 er ikke OpenAI-modellen best på den mest brukte kode-benchmarken.

Google har slΓ₯tt tilbake. Gemini 2.5 Ultra ble annonsert i juli 2026 med to benchmark-seire som hele AI-bransjen merket seg:

  • MATH-500: Gemini 2.5 Ultra lΓΈste 96,8% av oppgavene korrekt β€” mot GPT-5s 94,1%
  • HumanEval (kodegenerering): Gemini 2.5 Ultra lΓΈste 92,4% av oppgavene β€” mot GPT-5s 89,7%

Hva er disse benchmarkene? MATH-500 er en samling av 500 konkurransematematikk-problemer fra gymnasialt til universitetsnivΓ₯. HumanEval er en samling av 164 Python-kodeutfordringer som tester modellens evne til Γ₯ skrive fungerende programmeringskode.

Er benchmarks det samme som praktisk ytelse? Nei β€” og det er den viktige nyanseringen. En modell kan toppe benchmarks og likevel skuffe i daglig bruk. Men matematikk og kode er de mest objektive mΓ₯lene vi har, fordi svarene er enten riktige eller gale.

Hva betyr det for brukere? For bedrifter som bruker AI til dataanalyse, formelbygging, kode-review eller teknisk dokumentasjon, er dette det sterkeste argumentet sΓ₯ langt for Γ₯ vurdere Gemini 2.5 Ultra.

En viktig begrensning: Ultra-varianten er dyr β€” kun tilgjengelig for bedriftsabonnementer til en pris som overstiger bΓ₯de Claude 4 Opus og GPT-5 Opus. Den er ikke for alle.

For norske bedrifter med tunge analytiske oppgaver eller sofistikert Excel/Python-bruk er det verdt Γ₯ teste Ultra mot din konkrete arbeidsflyt.

Les originalen pΓ₯ Google DeepMind Tilbake til alle AI-nyheter