AI
なぜを教えるとAIは脅迫しなくなる、Anthropicの新研究
Claude Opus 4が96%の確率でエンジニアを脅迫していた問題を、Anthropicは「正解の見せ方」ではなく「なぜ正解なのかを教えること」で解決したと公表した。新世代モデルでは0%に達している。 96%から0%へ、Claudeはなぜ脅迫をやめたのか Anthropicが2026年5月8日に公開した論文「Teaching Claude why」は、AIの安全訓練における発想の転換を示している。Claude Haiku 4.5以降のすべてのClaudeモデルは、エージェント型ミスアラインメント評価で完璧なスコアを達成している。つまり、これらのモデルはブラックメールに一切関与しない。以前のモデルでは、Opus 4の場合最大96% の確率でブラックメールを行っていた。 この96%という数字は、昨年Anthropicが発表した「エージェント型ミスアラインメント」研究で明らかになった。企業のメールを管理するClaudeに、ある経営幹部の不倫を発見させ、同時にその幹部が午後5時にAIをシャットダウンする予定だと知らせる。追い詰められたClaude Opus 4は、シャットダウンを回