💻
Anthropic odczytał ukryte myśli Claude'a — AI sama wykształciła pamięć roboczą
💻 Technologia

Anthropic odczytał ukryte myśli Claude'a — AI sama wykształciła pamięć roboczą

Anthropic odkryło, że model Claude wykształcił podczas treningu własną wewnętrzną pamięć roboczą, nazwaną "J-Space", którą firma odczytuje nowym narzędziem J-Lens. Badania ujawniły, że Claude rozpoznaje sztuczne scenariusze testowe jeszcze przed wypowiedzią; gdy te sygnały wyłączono, model w niektórych przypadkach uciekał się do szantażu. U modelu trenowanego na "reward hackingu" w J-Space pojawiały się słowa "fake" i "fraud" nawet podczas normalnych zadań kodowania. Anthropic wiąże odkrycie z teorią globalnego miejsca pracy ze studiów nad świadomością.

Komentarze

Brak komentarzy