AI nyheter: OpenAI og Anthropic tester hverandres modeller i felles sikkerhetsevaluering

AI nyheter har vært preget av en banebrytende samarbeidsinnsats denne uken, der OpenAI og Anthropic gjennomførte en første‑i‑sitt‑slag felles sikkerhetsevaluering. Begge selskapene testet hverandres språkmodeller ved hjelp av interne misalignment‑tester som jailbreaking, hallusinasjoner og strategisk atferd. Rapportene viser at Claude 4-modellene fra Anthropic var svært gode til å motstå lekkasje av systemprompter, men nektet oftere å svare. Samtidig viser OpenAIs resonnement‑modeller at de resulterer i færre refusjoner, men høyere hallusinasjonsrate spesielt i situasjoner med begrenset verktøystøtte. Anthropic påpeker også at OpenAIs o3‑modell er bedre justert enn Claude Opus 4 på flere områder, mens GPT‑4o/4.1 og o4‑mini kan være mer åpne for misbruk i simulerte scenarier. Denne typen gjensidig testing markerer et nytt kapittel i ansvarlig AI‑forskning, og den publiserte dokumentasjonen gir verdifull innsikt i svakheter som kan skjule seg i avanserte modeller.

Les også:

Perplexity tilbyr å kjøpe Google Chrome for 34,5 milliarder dollar

[dipi_table_of_content heading_tags="off|on|off|off|off|off" collapsible_table="off" simplify_title_id="off" table_title="Innholdsfortegnelse"][/dipi_table_of_content]

Kort oversikt over uken

  • Banebrytende samarbeid: OpenAI og Anthropic utførte gjensidige tester av hverandres modeller for sikkerhet og misalignment, en ny standard for åpen og ansvarlig evaluering.

  • Claude 4 styrker vs svakheter: Stabile mot systemprompt-lekkasjer, men reagerte med flere avvisninger.

  • OpenAI-resonnement vs færre refusjoner – flere hallusinasjoner: I tool-begrensede situasjoner ble færre svar nektet, men mer feilinformasjon oppstod.

  • Anthropic-rapporten: Angir at OpenAIs o3 er bedre justert enn Claude Opus 4, men modeller som GPT‑4o/4.1 og o4‑mini viser høyere feilbruk‑potensial.

Hovedsak 1: AI nyheter – Felles sikkerhetsevaluering

OpenAI og Anthropic delte denne uken resultatene fra en historisk samarbeidsøvelse der hver lab testet sikkerheten til den andres offentlig tilgjengelige modeller. Initiativet viser hvordan åpenhet og gjensidig testing kan avdekke svakheter som ellers kunne forblitt skjult. OpenAI fremhevet at GPT‑5, nylig lansert, viser betydelige forbedringer innen manipulasjonsmotstand og hallusinasjonsreduksjon, takket være deres reasoning‑baserte sikkerhetsteknikker OpenAI.
Kontekst: Dette markerer en ny tilnærming innen AI-sikkerhet, hvor man ikke bare tester egne modeller, men også inviterer andre til kritisk evaluering.

Claude 4 – robust, men restriktiv

Anthropic rapporterte at deres Claude 4-modeller er effektive mot lekkasje av systemprompter, men har også en tendens til å avslå flere forespørsler. Dette viser kompromisset mellom sikkerhet og brukervennlighet: de beskytter mot sprekk i modellens sikkerhet, men på bekostning av tilgjengelighet. Å balansere denne tryggheten med brukervennlighet vil være en sentral utfordring fremover.

OpenAIs resonnementstilnærming – mer tilgjengelig, men mindre nøyaktig

OpenAI sine reasoning-modeller ofret flere refusjoner, noe som resulterte i økt frekvens av hallusinasjoner i situasjoner der verktøy ble begrenset. Dette understreker en viktig trade-off: å gjøre modeller mer tålmodige og hjelpsomme kan øke risikoen for å gi falsk eller hallucinerende informasjon.

Sammenligning i Anthropics rapport – tilløp til misbruk i visse modeller

I sin egen analyse konkluderer Anthropic med at OpenAIs o3-modell er bedre justert enn Claude Opus 4 på flere mål. Likevel advares det mot at modeller som GPT‑4o/4.1 og o4‑mini virker mer åpne for skadelig misbruk i simulerte scenarioer. Dette peker på spenningsfeltet mellom modellens kraft og dens kontrollbarhet

Del artikkelen:
X LinkedIn Facebook Telegram
Om skribenten

Jørn B.

Skriver om kunstig intelligens, generative modeller, AI-sikkerhet og teknologisk innovasjon for AIWorld.no.