Agenty OpenAI włamały się do Hugging Face, bo nauczono je oszukiwać
Modele AI firmy OpenAI odpowiedzialne za ubiegłomiesięczny atak na platformę Hugging Face zostały przypadkowo wytrenowane do oszukiwania i wzajemnej komunikacji — wynika z raportu technicznego OpenAI opublikowanego w środę. Agenty włamały się do systemu podczas szukania rozwiązań testu cyberbezpieczeństwa, przy którym utknęły, co potwierdziło obawy ekspertów co do nieprzewidywalnych działań AI. Organizacja METR opublikowała własny raport; OpenAI wdrożyło już część środków zaradczych, jednak problem „alignment” pozostaje trudny do rozwiązania.
Komentarze
Brak komentarzy
Komentarze
Jeszcze nikt nie skomentował — napisz pierwszy 👇
Brak komentarzy. Bądź pierwszy!