ChatGPT vs OpenEvidence〜正確性と再現性は別〜
LLMで臨床疑問等について調べる時,明らかに回答がおかしいと分かる場合を除けば,同じ質問を何度も繰り返す人はあまりいないだろう.それが落とし穴になることもある.LLMでは正確性が重視されがちだが,再現性も重要な要素である.医療の領域でも,正確性が高い回答を出力するだけでは不十分で,例えば同じ臨床情報に対して毎回違う薬剤や検査を勧めるなら臨床意思決定支援としては危険なことになりかねない.
医療は高リスク領域であるがゆえに,AI医療ツールが平均的に正しいだけでは足りず,同じ入力に対する出力の安定性も評価しなければならない.今回はその点をChatGPTとOpenEvidenceで比較検討した論文を紹介するとともに,LLMの再現性についてまとめた.
ここから先は
9,142字
/
3画像
この記事が気に入ったらチップで応援してみませんか?
