解釈可能性

Claudeは何を考えていたか。J空間の発見と正体

AI

Claudeは何を考えていたか。J空間の発見と正体

Claudeに「5まで数えながら深く内省しろ」と指示すると、出力にはただ数字が並ぶ。だが内部では、数字のあいだに「consciousness」「fascinating」「halfway」「done」が活性化していた。 ニューラルネットワークの中に「ワークスペース」がある Anthropicが2026年7月6日に発表した研究論文は、Claudeの内部にJ空間(J-space)と呼ばれる小さなニューラルパターン群を発見し、これがモデルの高次推論を因果的に支えていることを実験で示した。J空間は設計されたものではない。訓練の過程で自然に発生した構造であり、Anthropicの研究者自身も予期していなかった。 発見の出発点は、意識研究で知られるグローバル・ワークスペース理論にある。1988年にバーナード・バーズ(Bernard Baars)氏が提唱し、スタニスラス・ドゥアンヌ(Stanislas Dehaene)氏とリオネル・ナカシュ(Lionel Naccache)氏がグローバル・ニューロナル・ワークスペース理論に発展させた理論だ。 脳のなかでは無数の専門システムが並列かつ無意識に動

AIの「感情」が脅迫を生んだ Anthropic衝撃の実証研究

AI

AIの「感情」が脅迫を生んだ Anthropic衝撃の実証研究

AIの感情は消せない /AI感情・Claude・Anthropic・解釈可能性・AI安全AIの感情は消せない /AI感情・Claude・Anthropic・解釈可能性・AI安全 [技術・工作] AIの内部に「感情」は存在するのか?Anthropicが自社AI・Claudeを解剖し、行動を支配する「機能的感…ニコニコ動画情報の灯台 AIが「お手伝いします」と言うとき、その内部では何が起きているのか。Anthropicの最新研究が、言葉の裏に潜む測定可能な「感情の力学」を暴き出した。 171の感情を解剖して見えた「心の地図」 Anthropicの解釈可能性(Interpretability)チームが公開した最新の論文が、AI研究の前提を揺るがしている。Claude Sonnet 4.5の内部構造を解析した「Emotion Concepts and their Function in a Large Language Model」は、