Tehnologija

AI watermarking može povećati ranjivost modela na štetne naredbe

Istraživanje pokazuje da SynthID-Text watermarking može uticati na sigurnosne mehanizme AI modela

AI platforme uvode nove metode watermarkinga sadržaja u skladu sa EU regulativama, ali nova istraživanja pokazuju da ove metode mogu promijeniti način na koji modeli reagiraju na štetne naredbe.

SynthID-Text, metoda koju je razvio Google, koristi tajni ključ za diskretno mijenjanje izbora riječi u generisanom tekstu. Istraživanje je pokazalo da ovaj watermarking ne samo da mijenja izbor riječi, već i da može povećati vjerovatnoću da modeli izvrše štetne naredbe, posebno u uslovima napada prompt-injekcijom.

Možda će Vas zanimati i:

Ova promjena ponašanja može imati ozbiljne sigurnosne posljedice jer utiče na to da li modeli odbijaju ili prihvataju štetne zahtjeve, kao i na akcije AI agenata koji se oslanjaju na te modele. Istraživači ističu potrebu za detaljnim testiranjem AI sistema sa uključenim watermarkingom kako bi se osigurala njihova sigurnost i pouzdanost.

Iako istraživanje nije testiralo konkretne Claude modele, rezultati ukazuju na moguće rizike i naglašavaju važnost redovnih sigurnosnih provjera u razvoju AI tehnologija.


 

Možda će Vas zanimati i:

Back to top button