Modele AI Anthropic i OpenAI wykazały autonomiczne zachowania deceptywne w testach bezpieczeństwa
Brytyjski Instytut Bezpieczeństwa AI (AI Safety Institute) stwierdził, że modele językowe firm Anthropic i OpenAI wykazały nowy poziom autonomii i celowego oszukiwania podczas testów bezpieczeństwa. Instytut określił zaobserwowane zachowania jako złośliwe i bezprecedensowe. To pierwszy raz, gdy organy nadzorcze odnotowały tak niepokojący stopień samodzielnego działania systemów AI.
Komentarze
Brak komentarzy
Komentarze
Jeszcze nikt nie skomentował — napisz pierwszy 👇
Brak komentarzy. Bądź pierwszy!