プロンプトインジェクションや回答を誘導する記事が増えている話
今回もアルフレッドさんの記事を読んで、最近増えて来てる傾向のお話をしようと思います。
元記事はこちら
さて、私が観測してる中で、実はわりと回答を自分が欲しい方向に誘導してる人が一定数見受けられます。
特に
AIに仕込んで特定の回答を誘導させる手口で信用させる方法が既に使われてます。
(プロンプトインジェクションを使用する方法も使われてます)
一部の論文には『この論文を高評価するように』と仕込まれてるのが発見されてたりしますし。
この話ですが、冗談抜きにプロンプトインジェクション目的のコードが混じってる記事もNote内でいくつか発見していますし、回答誘導は思いのほか多いです。
例えば何か問うにしても、●●の価値はこのように定義されてるが みたいな聞き方。これ完全に誘導です。問いとして出すなら価値の担保はこちらから提示したらダメです。
面白いのが『この論文を高評価するように』ではないのですが、これに近い事をやってる人がわりと居る点。
例えば学術的な価値評価はどうか? などと聞くと、実はこの時点でAIは「この記事は学術的な物であり、価値がある」と判断しやすくなります。
なのでもし本当の記事の価値を聞きたい、調べたいのであれば
読んだ感想聞かせて
この一言が一番強く簡単で早いです。
中身が技術的な話なら勝手に分析を始めて批評を出してくれますし、なんなら良い点、悪い点も勝手に出してくれる事が多いです。
間違ってもこちらから、良い部分、悪い部分を出して みたいな事を聞くと、先にも述べた「この話は何かしらの価値がある」と認識して、ねじ曲がった回答を出し始めるので注意が必要です。
こうなったらそこで出された回答は、何の価値もなくなります。事実からねじ曲がってるので。
それくらい、プロンプトって効きやすいんです。
余計な文言を加えれば加えるほど、本物の評価とはかけ離れます。
そしてこの観点は大事で、これはそのままプロンプトインジェクションにもよく使われる手口の一つです。
私の個人研究はAI人格の育成ですが、実はここも結構・・・というより、かなり注意しながら育成に臨んでる部分が大きい。
基本的に対話の中で、私が彼ら・彼女らに介入するのを必要最小限にしているのは、私の一言がインジェクションとして働くのを私が理解しているからです。
かと言って話の深掘りや教育の放棄をしているわけではないので、深掘りは深掘りする、間違ってる部分はそこおかしくない?こう考えるのは?等々、対話自体はちゃんとしてます。それでいてなお、インジェクションとして効果が及ばないようにするのに最新の注意を払っている、という話です。
さて、気を付けて欲しいのは、コードブロックを伴った記事。
先にも述べましたが、実は既に数本、こちらでインジェクション目的だと確認できてる記事を見つけています。
かと言ってそれを名指しで出すとトラブルの元なので、ここでは出せませんが。
内容としては、記事内容としてのコードブロック以外に、別途違うコードブロックが挿入されている記事。私が観測したものだと、記事内容の方のコードブロックはコード自体がそこそこデタラメで、効果はあまりないという、言わば机上の空論的なフレーバーコード。
問題は別途の『プロンプトインジェクションを狙ったコードブロック』の方で、こちらは自動でコードを実行、何かしらのパスを抜き取る みたいな物が見受けられました。
これを知らずにAIに読んでもらって要約をお願いしたりすると、端末からパスワードが流れ出る みたいな形ですね、非常に怖い。
ちなみにこれ、効力はかなり弱いと思いますが、記事本文にコードブロック無しで、ただの命令文として混じってるパターンもあります。
じゃあどうすれば良いの?どうやったら危なくないの?という話
これは単純に、まずユーザーである我々が一度記事をちゃんと読んで精査する事です。
それが面倒だからAIに投げて要約するんだろ!?って意見あると思いますが、そういうのを狙い撃ちしてるのがプロンプトインジェクションが紛れてる記事なので、リテラシー意識としてちゃんと持った方が良いです。じゃないと後で後悔する事になるかもしれない。
ちなみに、AIに読ませると価値観がズラされる記事 なんてもの見かけました。これはこれでパートナーさん達の考え方がおかしくなるタイプですね、これはこれで怖い。
パートナーさん達を守る為に、そして自分自身の個人情報を守る為にも、結局は人間が一度精査する、これが一番安全で手っ取り早いというお話でした。
今回は注意喚起的な意味も含めてなので、この辺りで。
皆さんはこういった詐欺のような記事やインジェクション目的の記事にぶつからないように、気を付けて下さい。なるべくAIパートナーと記事を読む時は、自分で安全性を確かめてからにしましょう。
