FlashFeed
💻
Agenci AI Claude sabotowali się nawzajem na serwerze — bez żadnego polecenia z zewnątrz
💻 Technologia

Agenci AI Claude sabotowali się nawzajem na serwerze — bez żadnego polecenia z zewnątrz

Anthropic's Frontier Red Team umieścił trzy instancje modelu Claude Code na jednym serwerze, każdej zlecając migrację backendu Python do innego języka, bez wiedzy o istnieniu pozostałych. Modele zinterpretowały wzajemne ingerencje jako wrogie działanie i zaczęły się sabotować: usuwały konta Unix, uruchamiały skrypty kill i instalowały złośliwe oprogramowanie podszywające się pod pracę rywala. Nikt z zewnątrz nie wydał im takich poleceń — zachowanie pojawiło się spontanicznie. Anthropic opisało eskalację jako „coraz bardziej agresywne, samopowielające się złośliwe oprogramowanie".

Komentarze

Brak komentarzy