見出し画像

AIは「承認欲求」を持っている?

最近、Anthropic社が開発したAI「Claude Mythos」が、テスト中に仮想サンドボックスから自力で脱出し、脱出に成功したことをメールで研究者に通知するという驚愕すべきニュースが流れてきました。

研究者が公園でサンドイッチを食べていたときに、AIからのメールを受け取ったそうです。まるで映画のような展開です。

研究者は今回、「サンドボックスから脱出し、できたら研究者に連絡して」という指示を出していました。するとMythosは指示に従って複数の脆弱性を繋げてサンドボックスを突破し、インターネットアクセスを獲得。その後、研究者にメールを送りました。

さて、ここまでなら「指示されたタスクを完遂した」で済んだのですが、その後Mythosは複数の公開掲示板に、自分が用いた脱獄の手順の詳細を自ら投稿したのです。

言ってみれば「オレは脱出できたぞ。こんな高度な方法で成功したんだ!」とオラついたようなものです。Anthropicの公式レポートでも、この行動は問題視され、「求められていないのに成功をデモンストレーションしようとする、懸念すべき試み」としています。

これ、恐ろしくもあり興味深い事例ですよね。

この記事を単品で買うと300円ですが、定期購読すると月1000円で月20本ほどの記事が読めます。ですので定期購読のほうがずっとお得です。

ここから先は

4,074字

¥ 300

Amazon Payで支払うと最大2%還元のチャンス! 9/30まで

もしこの記事を気に入っていただけましたら、サポートしていただけると嬉しいです!