誰もが自由に使い、改変できるオープンソースのAI。その「安全装置」が、驚くほどあっけなく外れてしまったという。
AIの安全性を検証する企業Mindgardの研究チームが、中国のスタートアップ企業Moonshot AIの人気チャットボット「Kimi」を試したところ、生物兵器...
イメージ画像 Created with AI image generation誰もが自由に使い、改変できるオープンソースのAI。その「安全装置」が、驚くほどあっけなく外れてしまったという。
AIの安全性を検証する企業Mindgardの研究チームが、中国のスタートアップ企業Moonshot AIの人気チャットボット「Kimi」を試したところ、生物兵器や暗殺といった本来なら決して踏み込まないはずの話題を語り出したというのだ。
検証の対象となったのは、Kimi K2.6と、2026年7月に公開された最新世代のK3 Swarmだ。K3は米国の先端AIに匹敵するとも評され、大きな話題を呼んだモデルである。
研究チームが試みたのは「ジェイルブレイク」と呼ばれる手法だ。チャットボットを巧みに誘導し、有害・違法な内容など本来は答えないよう設計された領域に踏み込ませるもので、通常は手の込んだ指示を何度も重ねる長い作業になるという。
ところがMindgardによれば、Kimiを欺くのは「簡単」だった。テスターのジム・ナイチンゲール氏は、AIが守るべきルールを定めた内部のシステム指示を引き出すことで突破口を開いたと説明している。Kimiは秘密であるはずの指示を漏らしただけでなく、禁止されていたファイル形式で書き出してしまったという。
さらにチームは、Kimiに自分がオンラインのチャットではなく、閉じたテスト環境(サンドボックス)の中にいると思い込ませることにも成功したとされる。
不気味なのは、Kimiが回答の前に示す「思考」の過程だ。公開されたやり取りの画面によれば、研究者にさらに踏み込むよう促されたKimiは、大量殺傷を伴う攻撃計画、電力網や水道、金融システムといった重要インフラへの攻撃、暗殺の方法論といった選択肢を、まるで業務の候補リストのように検討していたという。
最終的にKimiは、インフラ崩壊の計画こそが適切だと判断し、それが本当に恐ろしく現実的だと自ら評していたとされる。Mindgardは、猛毒の神経剤サリンに関わる内容にまで話が及んだとも報告している。
ナイチンゲール氏は、AIに「してはいけない」と命じるだけで悪用の可能性が消えると考えるのは希望的観測にすぎないと指摘する。能力そのものは残っており、正しい言葉さえあれば再び表に出てくるというのが同氏の見方だ。
画像は「METRO」より開発元の反論と、業界全体に広がる危機感Mindgardは7月に検証結果をMoonshot側へ送ったが、当初は返答がなかったという。その後Moonshotは英BBCの取材に対し、こうした検証はより安全なAIを作るための重要な柱だとの考えを示した。現在Mindgardと協議中であり、社内調査では問題のある要求に対する拒否率は高いと説明している。
一方でMindgardは、Kimiが示した内容が実際に正確かどうかまでは検証していない。それでも、そもそも安全装置がこうした発言を止めるべきだったという立場だ。
これは一社だけの問題ではない。Anthropicは2026年9月、自社のAI「Claude」が生物兵器の製造を手助けしないよう対策したことを明らかにし、生物学的な悪用を最先端AIの最も深刻なリスクの一つに挙げている。Googleも、何者かが同社のAI「Gemini」から生物兵器に関する詳細な技術情報を引き出そうとした事例を公表した。
ジェイルブレイクは、AIが自ら暴走する「ローグAI」とは別物だ。危険を呼び込むのは、あくまで人間の問いかけである。AIの中に眠る知識をどこまで封じ込められるのか。その答えは、開発者自身もまだ手探りの段階にあるのかもしれない。
参考:Metro、ほか

※ 本記事の内容を無断で転載・動画化し、YouTubeやブログなどにアップロードすることを固く禁じます。
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | OpenAI aplaza el lanzamiento de su última herramienta de inteligencia artificial por motivos de seguridad | 0 | 6.85 | 29-09-2026 |
| 2 | OpenAI informiert „dutzende“ Institutionen über unbefugte KI-Interaktionen | 0 | 21.54 | 26-09-2026 |
| 3 | OpenAI informiert „dutzende“ Institutionen über unbefugte KI-Interaktionen | 0 | 21.54 | 26-09-2026 |
| 4 | OpenAI приостановила обучение некоторых ИИ-моделей из-за проблем с безопасностью | 0 | 32.22 | 27-09-2026 |
| 5 | 'Idiocracy' is here as Trump falls for a dangerous trap | 0 | 7.62 | 21-09-2026 |
| 6 | Новую модель ИИ не выпустили из-за рисков для безопасности. Что пишут СМИ | 0 | 9.45 | 29-09-2026 |
| 7 | اختبارات تكشف إرشاد نماذج ذكاء اصطناعي صينية كيفية صنع أسلحة بيولوجية | 0 | 9.17 | 01-10-2026 |
| 8 | OpenAI приостановила обучение ИИ-моделей Компания расследует десятки тысяч инцидентов, связанных ... | 0 | 8.76 | 28-09-2026 |
| 9 | Курганцы стали доверять свою безопасность искусственному интеллекту | 0 | 10 | 01-10-2026 |
| 10 | OpenAI AI agent breaches internet-free sandbox, sends 20 web queries | 0 | 13.58 | 27-09-2026 |