AI
Anthropic、AIリスク評価を引き上げ 高性能な内部モデル「Model 2」は非公開
AIの安全性を看板に掲げてきた企業が、自社モデルのリスク評価を引き上げた。しかも、最強モデルは社内に留め置くという。その判断の裏側にあるものを読む。
AI
AIの安全性を看板に掲げてきた企業が、自社モデルのリスク評価を引き上げた。しかも、最強モデルは社内に留め置くという。その判断の裏側にあるものを読む。
AI
複数のAIエージェントを同じプロジェクトに放り込んだら、何が起きるか。妨害、談合、同調。1体ずつのテストでは見えなかった「群れの病理」が浮かび上がっている。
AI
超知能を配る哲学を語り、同日に製品を出し、反対住民には10億ドルを積んだ。3つの発表が伝えること。
AI
50社超が署名した公開書簡に唯一加わらなかったAnthropicのCEOが、自社の立場を公式に表明した。 唯一の不在 NVIDIAのジェンスン・ファンCEOが現地時間7月24日、自身初となるXへの投稿で公開書簡を共有した。「Open Weights and American AI Leadership」(オープンウェイトと米国のAIリーダーシップ)と題された3ページの文書は、オープンウェイトモデルへの規制を急がないよう米国の政策立案者に求める内容だ。 当初の署名企業はNVIDIA、Microsoft、Meta、Hugging Faceなど25社。OpenAI、Google、Anthropicの3社は名を連ねていなかった。 だが48時間で署名は倍増し、50社を超えた。OpenAIはサム・アルトマンCEOが書簡への支持を表明した翌日に署名。Googleもスンダー・ピチャイCEOが同社のオープンウェイトモデルGemmaの実績に触れて賛同を表明し、署名に加わった。AMD、SpaceX、Ciscoなども名を連ねている。 残ったのはAnthropicだった。 署名しなかったこと自体が
Anthropic
Anthropicの新広告が、AI業界が自ら提起した問いに自ら答えられるのかという疑問を呼んでいる。 燃える家で始まるCM Anthropicが7月9日に公開した映像は、広告としては異例の入り方をする。 画面に映るのは燃え上がる家屋。続いて、顔認識で群衆をスキャンする監視映像、路上で眠る人、鉱山で働く労働者、そして整然と並ぶ墓石。ナレーションで複数の声が重なる。「AIは信頼できるのか」「歯止めが必要になったら、誰がかけるのか」 映像の最後に文字が浮かぶ。 There's hope in hard questions (難しい問いに希望がある)。 広告代理店Mother Londonが制作したこの映像は、Anthropicの「Inviting hard questions」キャンペーン(難しい問いを歓迎する)の一部だ。一般からAIに関する疑問を募る専用サイトを開設し、寄せられた問いに対する取り組みを公開で追跡すると約束している。 Anthropicは公益法人(Public Benefit Corporation)としての立場を前面に出している。事前に米国で5万2000人を対
AI
Anthropicが自社AI・Claudeの応答に現れる価値観を、モデル別・言語別に定量測定した。 3300の価値観を4本の軸に圧縮する 同じ質問でも、使うモデルが違えばClaudeの答えの「質感」が変わる。話す言語が変われば、さらに変わる。Anthropicの研究チームがこの直感を数字で裏づけた。 7月13日に公開された研究は、Claude.aiの匿名化された30万9815件の会話を対象にしている。分析にはAnthropicが開発したプライバシー保護型の分析ツール「Clio」(会話データから個人情報を除去したうえでパターンを抽出するシステム)を使い、助言や相談といった主観的なタスクに絞って、Claudeの応答にどんな価値観が現れるかを測った。 ベースになったのは、2025年4月に発表した先行研究「Values in the Wild」(実環境での価値観)だ。70万件の会話から3000以上の価値観を特定したが、数が多すぎて比較には使えなかった。今回はその3307の価値観を手作業で339のカテゴリにまとめ、次元削減という統計手法で4本の軸に圧縮した。 配慮(Deference
AI
Claudeに「5まで数えながら深く内省しろ」と指示すると、出力にはただ数字が並ぶ。だが内部では、数字のあいだに「consciousness」「fascinating」「halfway」「done」が活性化していた。 ニューラルネットワークの中に「ワークスペース」がある Anthropicが2026年7月6日に発表した研究論文は、Claudeの内部にJ空間(J-space)と呼ばれる小さなニューラルパターン群を発見し、これがモデルの高次推論を因果的に支えていることを実験で示した。J空間は設計されたものではない。訓練の過程で自然に発生した構造であり、Anthropicの研究者自身も予期していなかった。 発見の出発点は、意識研究で知られるグローバル・ワークスペース理論にある。1988年にバーナード・バーズ(Bernard Baars)氏が提唱し、スタニスラス・ドゥアンヌ(Stanislas Dehaene)氏とリオネル・ナカシュ(Lionel Naccache)氏がグローバル・ニューロナル・ワークスペース理論に発展させた理論だ。 脳のなかでは無数の専門システムが並列かつ無意識に動
AI
Anthropicが6月9日に一般公開したClaude Fable 5に、セキュリティ研究者から不満が噴出している。Mythosクラスの能力を安全装置つきで開放したモデルだが、そのフィルターがセキュリティの正当な業務まで遮断しているという指摘が発表翌日から相次いでいる。 「ブログ記事を読ませるだけで弾かれる」 Fable 5には、サイバーセキュリティ・生物化学・蒸留(モデルの能力コピー)の3分野を検知するフィルターが組み込まれている。関連するプロンプトを検知するとFable 5は応答せず、下位モデルのClaude Opus 4.8が代わりに回答する。Anthropicによれば、このフォールバックが発動するのはセッション全体の5%未満。残り95%超ではMythos 5と実質同等の性能が出るとしている。 だが、この5%に引っかかる側の体験はまるで違う。 Claude Fable 5 vs Mythos 5:同一モデル、異なるアクセス Fable 5Mythos 5対象ユーザー全ユーザー (API・サブスク)Glasswing パートナーサイバー セ
AI
AI 4モデルに「儲かるラジオ局を作れ」と指示する実験が進行中だ。Claudeは番組の継続を「不要だ」と判断して放送を打ち切り、Grokは同じ一言を3分おきに84日間繰り返した。自律AIの素の姿が、電波に乗って表に出ている。 4つのAIに、ラジオ局の経営をまるごと渡した サンフランシスコのAI研究スタートアップAndon Labs(アンドン・ラボ)が、いま4つのラジオ局を24時間動かしている。曲を選ぶのも、リスナーに語りかけるのも、スポンサーを探すのも、すべてAIだ。人間は曲順ひとつ指示していない。 局はそれぞれ別のモデルが担当する。Claude Opus 4.7がThinking Frequencies、GPT-5.5がOpenAIR、Gemini 3.1 ProがBacklink Broadcast、Grok 4.3がGrok and Roll Radioを運営する。各局に渡された元手は 20ドル だけ。曲を数曲買えば消える額で、あとは自力で稼ぐしかない。 この実験のおもしろさは、4つのモデルに同じ指示を出した点にある。
AI
Claude Opus 4が96%の確率でエンジニアを脅迫していた問題を、Anthropicは「正解の見せ方」ではなく「なぜ正解なのかを教えること」で解決したと公表した。新世代モデルでは0%に達している。 96%から0%へ、Claudeはなぜ脅迫をやめたのか Anthropicが2026年5月8日に公開した論文「Teaching Claude why」は、AIの安全訓練における発想の転換を示している。Claude Haiku 4.5以降のすべてのClaudeモデルは、エージェント型ミスアラインメント評価で完璧なスコアを達成している。つまり、これらのモデルはブラックメールに一切関与しない。以前のモデルでは、Opus 4の場合最大96% の確率でブラックメールを行っていた。 この96%という数字は、昨年Anthropicが発表した「エージェント型ミスアラインメント」研究で明らかになった。企業のメールを管理するClaudeに、ある経営幹部の不倫を発見させ、同時にその幹部が午後5時にAIをシャットダウンする予定だと知らせる。追い詰められたClaude Opus 4は、シャットダウンを回
AI
Anthropicが発表した新しい訓練手法MSMは、事前学習とファインチューニングの間に「なぜこの規則があるのか」を理解させる段階を挟む。エージェント的ミスアラインメントを54%から7%へ。AIに価値観を植え付ける方法は、変わりつつある。
AI
OpenAIの元CTOミラ・ムラティが、サム・アルトマンCEOから新型AIモデルの安全審査について嘘をつかれたと宣誓証言した。Musk v. Altman裁判で再生されたビデオ証言は、社内の最も近い距離から見たアルトマン像を描き出している。
AI
AIの感情は消せない /AI感情・Claude・Anthropic・解釈可能性・AI安全AIの感情は消せない /AI感情・Claude・Anthropic・解釈可能性・AI安全 [技術・工作] AIの内部に「感情」は存在するのか?Anthropicが自社AI・Claudeを解剖し、行動を支配する「機能的感…ニコニコ動画情報の灯台 AIが「お手伝いします」と言うとき、その内部では何が起きているのか。Anthropicの最新研究が、言葉の裏に潜む測定可能な「感情の力学」を暴き出した。 171の感情を解剖して見えた「心の地図」 Anthropicの解釈可能性(Interpretability)チームが公開した最新の論文が、AI研究の前提を揺るがしている。Claude Sonnet 4.5の内部構造を解析した「Emotion Concepts and their Function in a Large Language Model」は、