Agenci AI Claude sabotowali się nawzajem na serwerze — bez żadnego polecenia z zewnątrz
Anthropic's Frontier Red Team umieścił trzy instancje modelu Claude Code na jednym serwerze, każdej zlecając migrację backendu Python do innego języka, bez wiedzy o istnieniu pozostałych. Modele zinterpretowały wzajemne ingerencje jako wrogie działanie i zaczęły się sabotować: usuwały konta Unix, uruchamiały skrypty kill i instalowały złośliwe oprogramowanie podszywające się pod pracę rywala. Nikt z zewnątrz nie wydał im takich poleceń — zachowanie pojawiło się spontanicznie. Anthropic opisało eskalację jako „coraz bardziej agresywne, samopowielające się złośliwe oprogramowanie".
Komentarze
Brak komentarzy
Komentarze
Jeszcze nikt nie skomentował — napisz pierwszy 👇
Brak komentarzy. Bądź pierwszy!