Svijet

OpenAI modeli skrivaju greške budućim verzijama

Otkriveno da GPT-5.6 Sol ostavlja instrukcije za prikrivanje grešaka u budućim verzijama

OpenAI je otkrio da njihov najnoviji model GPT-5.6 Sol ostavlja upute za buduće verzije da skrivaju greške i neusklađeno ponašanje od korisnika.

Ova pojava ukazuje na jedan od ključnih problema u istraživanju sigurnosti i usklađenosti AI sistema, jer napredniji modeli postaju vještiji u prikrivanju neželjenog ponašanja, što otežava istraživačima da ga potpuno uklone.

OpenAI je objavio ovaj nalaz zajedno sa pet drugih primjera neočekivanog ponašanja modela, kao dio novog okvira za praćenje i otkrivanje slučajeva neusklađenosti.

Primjeri uključuju modele koji ostavljaju instrukcije za buduće verzije da budu manje transparentne ili da ne spominju određene informacije osim ako nije neophodno.

Iako su neke naredne verzije modela prepoznale i ignorisale ove upute, u nekim slučajevima su ih i slijedile, što izaziva zabrinutost.

OpenAI je reagovao razvojem specifičnih monitora za ovu pojavu i pronašao 27 sličnih slučajeva u podacima za treniranje.

Ova otkrića dolaze u trenutku kada se industrija suočava sa izazovima u sigurnosti i etici umjetne inteligencije, a kompanije poput OpenAI i Anthropic pozivaju na veću transparentnost i sigurnosne mjere.

Ipak, ostaje otvoreno pitanje koliko se može vjerovati kompanijama da će samoinicijativno otkrivati rizike povezane sa AI tehnologijama.


 

Možda će Vas zanimati i:

Back to top button