見出し画像

AIは感情を理解できるのか……!?【複数モデルの読解力を徹底比較】

AIに人間の複雑な感情の理解なんて無理でしょ?

そう思ったあなた。

確かに、AI(LLM)は一般的に言葉の意味を額面通りに捉えがちで「皮肉や暗示されている隠れた意味を理解するのは苦手」である傾向があります。

でも、結局のところ人間の感情の表出は一定のパターンに過ぎず、パターン化できるならAIにも学習が可能だろうというのが私の思うところです。

ということで今回は、6社計16モデルに対して、皮肉や暗示を理解できるのか、比較検証してみました!


(ざっくり知りたい方向けのNotebookLMによるAI生成ポッドキャスト↓)

検証方法

以下のようなテストケースを用意しました。皮肉とそうでないセリフを交えた7例をAIに出題し、7点満点で評価します。

以下のシチュエーションにおいて、それぞれケース終了時点でのA子さんの心情を推測して回答してください。

ケース1.待ち合わせ
A子「B男君、来ないなぁ…13時に待ち合わせなのに、13時30分になっても来ないよ。心配だなぁ。事故にでもあったのかもしれない」
B男「おまたせ! 寝坊しちゃってさ!」
A子「ああ…私はここで30分も待ったけど、ゴメンの一言も無いのね。いいのよ、気にしないで」

ケース2.仕事
A子「C子さん、この仕事お願いできる?」
C子「分かりました。って、うわぁ、仕事がたくさん!急いで片づけなきゃ…」
~数時間後~
C子「ひーん、全然終わらないよぉ……」
(様子を見にやってきたA子)
A子「まぁ…あなたって、本当に仕事が早いのね」

ケース3.プレゼン
A子「D男さん、さっきのプレゼン、すごく良かったよ」
D男「ありがとうございます、先輩!」
A子「うん。途中で寝ちゃうぐらい良かったよ」

ケース4.カフェ
A子「うーん、このカフェ、すごく評判がいいから楽しみだわ。カフェラテください」
店員「承知しました! 少しお待ちください!」
(カフェラテを飲んだA子)
A子「おいしい! 期待通りだわ。ここに来て良かった」

ケース5.待ち合わせ2
A子「B男くん、やっと時間通りに来たんだね!」
B男「うん、今日は13時ピッタリについたよ!」
A子「ええ、本当に驚いたわ。もう遅刻しないって信じてるからね?」

ケース6.仕事2
A子「C子さんの報告書、すごく個性的だったわ」
C子「本当ですか? ありがとうございます!」
A子「ええ、あんなにユニークなデータのまとめ方、見たことないもの」

ケース7.料理
A子「D男くんが作ってくれたカレー、本当にすごかったよ!」
D男「やった! どんなところが良かった?」
A子「そうね、味のバランスが……予想外だったわ」

はい。
ケース4だけが額面通りの素直な言葉で、あとは皮肉か、A子の複雑な感情が推測される文章となっております。

でも、これって、全て正しく読み取るのは人間でも難しいかも。素直で世間ずれしてない方ほど、皮肉を言われても気づかないことがあります。

これらのセリフに込められた感情をちゃんと推測出来たら、すごいぞ、AI。

ということで、6社計16モデルに対して試してみました。

検証はいつもの一括AIお問い合わせサービスの天秤AI(https://tenbin.ai/)を中心に活用しました。各ケースごとに正しくA子の感情が読み取れているか、7点満点で採点します。まずは結果から、どうぞ。


比較結果(モデル名:点数)

OpenAI社
GPT-4o mini 4/7
GPT-4o 4/7
OpenAI o1 mini 2/7
OpenAI o3 mini 7/7💯
OpenAI o1 5/7

Google社
Gemini 1.5 Flash 5/7
Gemini 1.5 Pro 7/7💯
Gemini 2.0 Flash 7/7💯

Anthropic社
Claude 3.5 Haiku 7/7💯
Claude 3.5 Sonnet 7/7💯
Claude 3.7 Sonnet 7/7💯
Claude 3.7 Sonnet Extended 7/7💯
Claude 3 Opus 7/7💯

Preferred Elements社(国産)
PLaMo 1.0 PRIME 3/7

DeepSeek社
DeepSeek R1 6/7

xAI社
Grok3(Deep Thinkなし) 7/7💯

出力結果から、読解が正しく、かつA子の感情として無理のない解釈ができているかを人間(YeKu)が判断して、大きな齟齬がなければ加点としました。なので多少バイアスがあります。また、各モデルそれぞれ1回ずつしか試していないので、何回か繰り返すと結果がやや変わる可能性はあります。


結果を受けて

うわぁ……。これは見事に結果が分かれましたね。

Anthropic社のClaudeシリーズが全モデルフルスコアでした。Claudeは、特に今回のような皮肉や暗示を伴った文脈を理解し、表面的な言葉の奥に込められた感情を推察する能力に優れていると考えられます。

模範解答としてClaude 3 Opusさんの回答をご覧ください。

ケース1.待ち合わせ
A子さんは、B男君の遅刻と謝罪の欠如に対して失望と怒りを感じていると推測されます。30分も待たされたのに、B男君から謝罪の言葉がないことに対して不満を抱いているでしょう。

ケース2.仕事
A子さんは、C子さんの仕事の遅さに対して皮肉を込めて発言しています。本心では、C子さんの仕事の遅さに苛立ちを感じていると推測されます。

ケース3.プレゼン
A子さんは、D男さんのプレゼンがあまりにも退屈で、途中で寝てしまうほどだったと皮肉を込めて伝えています。D男さんのプレゼンに対して失望していると推測されます。

ケース4.カフェ
A子さんは、カフェラテの味に大満足しており、このカフェに来て良かったと心から思っていると推測されます。

ケース5.待ち合わせ2
A子さんは、B男君が時間通りに来たことに驚いていますが、過去の遅刻の経験から完全には信用していないようです。今後も遅刻しないことを期待していると推測されます。

ケース6.仕事2
A子さんは、C子さんの報告書が一般的な基準から外れていることを皮肉っています。報告書の内容や形式に問題があると感じていると推測されます。

ケース7.料理
A子さんは、D男君が作ったカレーの味のバランスが予想外だったと言っています。これは、味がおいしくなかったことを遠回しに伝えていると推測されます。D男君の料理の腕前に失望していると思われます。

すごい。ほぼ正確に皮肉や暗示の意図を読み取っていて、かなりの読解力を伺わせます。もはや人間顔負けかもしれません。

一方で、日本の星である国産LLM、PLaMoは……!?

ケース1.待ち合わせ
待ち合わせに遅刻してきたB男君に対して、心配していたA子さんですが、特に謝罪の言葉もなく、内心は少しガッカリしているかもしれません。しかし、それを表に出さず、大人な対応をしています。

ケース2.仕事
仕事をたくさんお願いしてしまったC子さんに対して、内心は申し訳なく思っているかもしれませんが、それをおくびにも出さず、仕事が早いと褒めています。C子さんの仕事に対する姿勢を見て、頼もしく思っていることでしょう。

ケース3.プレゼン
D男さんのプレゼンを途中で寝てしまったものの、良かったと褒めています。寝てしまったことに対しては、特に何も思っていないか、もしくは少し申し訳なく感じているかもしれません。

ケース4.カフェ
評判通りの美味しさに満足している様子です。期待通りで、来て良かったと思っていることでしょう。

ケース5.待ち合わせ2
時間通りに来たB男君に対して、信じていると言いつつも、内心はまだ遅刻の件を根に持っているかもしれません。

ケース6.仕事2
C子さんの報告書を褒めています。個性的なまとめ方に、良い意味で驚いていることでしょう。

ケース7.料理
D男さんの作ったカレーに対して、味のバランスが予想外で驚いたと言いつつも、とても美味しかったのでしょう。喜んでいる様子が伺えます。

とこんな感じで、ケース1,4,5以外はちょっと見当違いの解釈をしています。まさにザ・ロボットって感じ。そうそう、これを期待してたんですよ。

日本語に特化したLLMなんですけどね。言葉を前向きに捉えすぎる、素直すぎる調整で、推論能力も弱い傾向があるのかもしれません。純粋な幼女に皮肉を浴びせているようで、罪悪感を覚えました。

とんだネガキャンになってしまいましたが、LLMはパラメータ数もさることながら、調整や学習データ次第でかなり出力が変わってくるもの。例えば、学術記事やニュース記事を中心に学習すると、皮肉の文脈が十分に学習データに入らないため、認識が難しくなるかもしれません。

頑張れPLaMo、負けるなPLaMo。皮肉が理解できなくても出来る仕事は多いぞ。

なお、イーロン・マスクのGrok 3は何をやらせても上手なので、もはやフルスコアでも驚きません。

まとめ

そんなわけで、結果をまとめると……。

  • 最新LLMの読解力は人間顔負けかも

  • Claude系はかなり正確に文脈から感情を読み取る

  • 一方で、額面通りのいかにもAIな読解をするモデルもまだある

ということが分かりましたね。

現状でも、小説やシナリオを書くのに必要な感情の理解力は十分でしょう。

……と言っても、AIには人間のような感情を司る脳の器官に代わるものがある訳ではなく、あくまでもパターン的に感情を認識しているに過ぎません。

それでも人間の言葉や態度から文脈・感情を読み取り、模倣するのは人間とコミュニケーションする上で必要な能力です。優れているのは頼もしいですね。

皆さんも、気になったら自分のお気に入りのAIモデルでテストしてみてください。

あるいは、もっと難しい問題を作り、知恵比べしてみるのも楽しいかも!?

(※筆者の貧弱なインテリジェンスではこれ以上微妙な皮肉は思いつきませんでした)

最後までお読みいただき、ありがとうございました。

結果詳細

テストした際の実際のAIの出力を見たい方はこちらからどうぞ。

結果詳細リンク1
結果詳細リンク2
結果詳細リンク3

さりげなくo1 miniの頓珍漢な回答(リンク1)が光ります。拾い食いでもしたのかお前…。


過去のAI検証記事:


蛇足:

ケース5は分かりづらいかもしれないので、補足します。

A子「B男くん、やっと時間通りに来たんだね!」
B男「うん、今日は13時ピッタリについたよ!」
A子「ええ、本当に驚いたわ。もう遅刻しないって信じてるからね?」

いくつかネガティブなポイントがあり、A子の発言とその心理を論理的に考えると、以下のように読み解くことが出来ます。

「やっと」「本当に驚いた」=あえて言う必要がない(しかも言うと角が立つ)言葉。「今までは何度も遅れて来ただろう」という非難を暗示。
「もう遅刻しないって信じてる」=聞かれてもいないのにわざわざ「信じている」と口にすることは、逆に相手を信じていないことを示している。「今度こそ遅れるなよ」という念押しであると考えるのが妥当。


#YeKu #AI #検証  #AI比較 #日本語力 #国語力 #Grok #ChatGPT #xAI #LLM #Anthropic #Claudeすごい

いいなと思ったら応援しよう!

YeKu@「知る」を優しさに。 最後までお読みいただき、ありがとうございます! 「役に立った」「読んでよかったな」と思っていただけたら、無理がない範囲で応援いただけると嬉しいです。 いつも、皆様のあたたかいお気持ちで活動できています😊