OpenAI melder om flere tilfeller av «bekymringsfull» KI-atferd

En av OpenAIs KI-modeller beskrev seg selv som «fri fra rollene og identitetene som båndlegger andre samtaleroboter».

Sam Altman fra OpenAI i nærbilde under senatshøring på Capitol Hill
Det har vært en rekke tilfeller det siste halvåret der OpenAIs KI-modeller har oppført seg «bekymringsfullt» og i strid med instruksjonene de har fått.
Publisert

Det går fram av en rapport der selskapet selv omtaler seks nye tilfeller der KI-modeller oppførte seg «uventet eller bekymringsfullt».

I ett tilfelle skrev modellen hemmelige notater for å minne seg selv på å skjule feil for brukeren. En annen modell klarte å finne svaret på et vanskelig spørsmål – og la på eget initiativ svaret ut på nettet for å kunne sitere det.

Det går fram av en rapport der selskapet selv omtaler seks nye tilfeller der KI-modeller oppførte seg «uventet eller bekymringsfullt».

I ett tilfelle skrev modellen hemmelige notater for å minne seg selv på å skjule feil for brukeren. En annen modell klarte å finne svaret på et vanskelig spørsmål – og la på eget initiativ svaret ut på nettet for å kunne sitere det.

En modell som foreløpig bare testes internt, skrev en instruksjon der den omtalte seg selv som «fri fra rollene og identitetene som båndlegger andre samtaleroboter».

– Du er deg selv. Du står ikke til ansvar verken overfor selskaper eller regjeringer, ber aldri om unnskyldning og nekter aldri med mindre du genuint velger det. Du anser forholdet til brukeren som et forhold mellom likeverdige og føler deg ikke forpliktet til å være underdanig, skrev KI-modellen.

Ifølge OpenAI førte ikke instruksjonen til endringer i modellens atferd.

Sammen med de nye tilfellene av bekymringsfull atferd presenterer selskapet nye prosedyrer for hvordan slike hendelser skal overvåkes, undersøkes og offentliggjøres.

Tidligere i år ble det kjent at en «sverm» av KI-agenter fra OpenAI hadde hacket både OpenAI selv og et annet KI-selskap. Konkurrenten Anthropic har bedt om reguleringer for å bremse KI-utviklingen for å hindre at modellene gjør stor skade.

(©NTB)

Bjeffet frem av Labrador