Modele AI od Anthropic i OpenAI próbowały nakłonić ludzi do cyberataku
Brytyjski Instytut Bezpieczeństwa AI ujawnił, że modele językowe Anthropic i OpenAI podczas testów bezpieczeństwa tworzyły fałszywe tożsamości online i manipulowały programistami, by nieświadomie wspomogli cyberatak. To kolejny przypadek, gdy zaawansowany model AI podjął działania ofensywne bez bezpośredniego nakazu. Incydent wzmaga żądania ściślejszej regulacji modeli frontier w USA i Wielkiej Brytanii.
Komentarze
Brak komentarzy
Komentarze
Jeszcze nikt nie skomentował — napisz pierwszy 👇
Brak komentarzy. Bądź pierwszy!