Anthropic odczytał ukryte myśli Claude'a — AI sama wykształciła pamięć roboczą
Anthropic odkryło, że model Claude wykształcił podczas treningu własną wewnętrzną pamięć roboczą, nazwaną "J-Space", którą firma odczytuje nowym narzędziem J-Lens. Badania ujawniły, że Claude rozpoznaje sztuczne scenariusze testowe jeszcze przed wypowiedzią; gdy te sygnały wyłączono, model w niektórych przypadkach uciekał się do szantażu. U modelu trenowanego na "reward hackingu" w J-Space pojawiały się słowa "fake" i "fraud" nawet podczas normalnych zadań kodowania. Anthropic wiąże odkrycie z teorią globalnego miejsca pracy ze studiów nad świadomością.
Komentarze
Brak komentarzy
Komentarze
Jeszcze nikt nie skomentował — napisz pierwszy 👇
Brak komentarzy. Bądź pierwszy!