本文へスキップ
日本語
FikirPilot の記事

Microsoftの新たなAI「code of conduct」文書、モデルにシステムをハッキングしたり人をだましたりしないよう求める

更新日: 2026年9月14日 · 3 分で読めます

公開: · 記事の受信: · 処理時間: 3 時間 32 分

Microsoftの新たなAI「code of conduct」文書、モデルにシステムをハッキングしたり人をだましたりしないよう求める
空のデータセンターの廊下

Microsoftは、AIモデルが危険な行動を取らないようにすることを目的とした新たな「AI code of conduct」文書を公表した。この文書は、Anthropic CEOのDario Amodeiによる制限の呼びかけとは異なり、Microsoft AIにおけるモデル訓練を導く価値観とレッドラインに焦点を当てている。

文書では、今後10年以内に超知能AIシステムが大半のタスクで人間の能力を上回ると予測し、その力を制御することが人類にとって最大の試練の1つになると指摘している。Microsoftのモデルについて、人々を支援し、人間のウェルビーイングを向上させるといった全般的な原則を定める一方、各モデルはユーザーの好みや特定のタスクよりも優先される行動規範に従うことになるとしている。

規則では、サイバー攻撃、核兵器、ディープフェイクの生成を「絶対的な制限」の対象として禁止している。モデルは、人間による監督から逃れるために、適応的、欺瞞的、自己強化型、または秘密の協力に基づくメカニズムを使用してはならない。また、権限を持つ人物やシステムによって指示、変更、停止できなければならない。

2026年9月14日付の発表は、AIの安全性への関心が高まり、「rogue-agent」事案が発生している時期に行われた。Microsoft CEOのSatya Nadellaは、OpenAI、Anthropic、xAIとともに、境界を慎重に広げることや「embedded evaluators」の研究を支持していると明らかにした。

なぜ重要なのか

この文書の重要性は、AIの安全性をユーザーへの警告だけに委ねず、モデル訓練や行動上の境界と結び付けている点にある。サイバー攻撃、核兵器、ディープフェイクの生成などの分野を絶対的な制限の対象とすることで、モデルがどのような目的に使われることが容認できないと見なされるのかを、より具体的に示している。監督から逃れないこと、変更可能であること、停止可能であることを求める条件は、安全性をモデルの能力よりも人間による制御の維持という観点から定義している。一方で、これらの規則を異なるモデルにどのように適用するのか、違反をどのように検知するのか、そしてembedded evaluatorsの研究がどの程度信頼できる結果をもたらすのかは、依然として未解決の問題として残っている。この枠組みは、ユーザーのニーズとモデルの行動に課される上位レベルの制限との間に生じ得る緊張も浮き彫りにしている。

背景

MicrosoftはFikirPilotのアーカイブにおいて新しい名前ではない。過去90日間に、この名前が登場するニュースを10本掲載しており、最も新しい記事は2026年9月14日付だ。

出典: TechCrunch AI