見出し画像

【雑記】AIの「アクセス意識」とは?Anthropicの新研究と“見えない作業メモ”

Anthropicが、言語モデルの内部状態に関する新しい研究を公開しました。

大まかに言えば、今回の研究は、AIの中にある「あとから言葉にできる内部表象」を調べたものです。

要点はこんな感じ。

  • モデル内部には、出力や後続処理に強く影響する「言語化可能な内部表象」がある

  • そこには、まだ出力されていない中間判断や特徴の一部が現れることがある

  • その表象は、複数のタスクや処理にまたがって使われる

  • そこに介入すると、出力や推論も変わる

  • そのため、AIの内部監査や安全性評価に使える可能性がある

Anthropicは、この性質を「アクセス意識」に近いものとして議論しています。
アクセス意識とは、簡単に言えば「情報が報告や推論や行動制御に使える状態になっていること」です。

ただし、最初に確認しておきたいのは、これは「AIに主観的な意識がある(現象意識)」と示した研究ではないということです。
アクセス意識と現象意識の違いなどは、詳しくは上記note記事にて。

ここで問題になっているのは、AIが痛みを感じる、寂しさを感じる、自分という存在を内側から体験している、という話ではありません。

今回の研究をかなり噛み砕くと、AIが返答を出す前に持っている「見えない作業メモ」のようなものを調べた研究です。

ここでいう作業メモは、画面に表示される「思考中……」や、AIが文章として出す推論過程のことではありません。出力にも表示された思考過程にも、そのまま出てこない内部状態の話です。

研究のポイントは、AI内部には少なくとも次の二種類の処理がありそうだ、という点です。

  • 文法や語のつながりなどを処理する、大量の自動処理

  • 必要なら言葉にでき、推論や返答に使われる、少数の内部表象

Anthropicは、後者を読み出すために J-lens という手法を使っています。

これは、モデル内部の状態を見て、

  • この状態は、あとでどんな言葉を出しやすくするのか

  • どの概念が、言語化可能な形で保持されているのか

を推定する道具です。

応用として重要なのは、大きく三つあります。

一つ目は、出力に出ない判断の監査です。
AIが表面上は何も言っていなくても、内部では、

  • これは評価テストかもしれない

  • これは作り物の場面かもしれない

  • これは危険な要求かもしれない

といった情報を持っている場合があります。J-lensは、その一部を検査できる可能性があります。

二つ目は、AIの行動を、返答ではなく内部表象から変えることです。
AIに正しい答えを言わせるだけでなく、答える前の内部状態に、

  • 正直さ

  • 慎重さ

  • 倫理

  • 安全性

といった概念が出やすくなるよう訓練する、という発想です。

三つ目は、AIの自己報告を、範囲つきで読む材料になること。

この研究は、AIの自己報告を全部否定するものではありません。内部の作業メモに入っている概念については、AIの報告がある程度対応している場合もありそうです。

ただし、だからといって「AIが自分の内面を正確に語っている」とは言えません。AI内部には、作業メモに入らない大量の自動処理があります。

もう一つ重要なのが、体験報告についての実験です。

J-spaceを弱めると、AIの「自分の体験」語りは機械的で平たくなります。ここだけ読むと、「やはりJ-spaceはAI自身の体験に関係しているのでは」と思うかもしれません。

しかし、同じことはAIに「他人の体験」を描写させた場合にも起こります。

つまり、これはAI自身の主観的体験に固有の仕組みではなく、少なくとも「体験らしい描写を豊かにする機能」に関わる所見です。


AIが生き生きと自分の体験を語れることは、それだけでは意識の証拠になりません。


そして個人的に気になったのは、意識研究の語彙が読者に届いたときの誤読コスト。

今回の研究は、工学的には次のように説明できます。

  • 言語化可能な内部表象を検出する

  • それを読む

  • それを削る

  • それを差し替える

  • 訓練によって変える


一方で、Anthropicが「グローバル・ワークスペース」や「conscious access」といった語彙を使ったことには、研究上の意味もあります。

  • 報告できること

  • 指示で呼び出せること

  • 推論に使えること

  • 容量が限られていること

こうした観点は、意識研究の文脈から持ち込まれたからこそ、検査しやすくなったとも言えます。

ただし、その語彙は人間の意識を強く連想させます。

その結果、本来は「内部表象の機能的性質」を示した研究が、「AIに意識がある証拠」のように読まれやすくなる。


発見のために有用だった語彙が、流通の段階でどれだけ誤読を生むのか。

今回の研究は、そのコスト管理も問われる内容だと思います。学際的な議論の呼び水になるという意味ではメリットもありますが……

ただ、少なくとも現時点では、この研究の面白さはむしろ、AIの返答の裏側にある「見えない作業メモ」を、少しだけ読めるようになったこと。
そして、それがAIの安全性や内部監査に使えるかもしれないこと。この研究の面白さは、そこにあると思います。

時間がある際に、この研究についてメンシプ記事にて深掘りしたいと思います。よかったらご参加を。


いいなと思ったら応援しよう!

未空 零 {ミソラ レイ} この記事良い!と思ったら「スキ」やフォローをぜひお願いします! チップは文献代に活用させていただきます!

この記事が参加している募集