DeepResearch競馬予想レポート14|青葉賞、マイラーズC、フローラSの結果
【前回の結果】
今回は、先週行われた青葉賞、マイラーズカップ(マイラーズC)、フローラステークス(フローラS)における予想とその結果をご報告します。
今回より、Felo(ResearchAgent)を追加しました。
これは、これまで使用していた「Felo」のディープリサーチ機能のモデル選択が移行したものです。今後はResearchAgentの性能検証を主に行います。(なお、o4mini, 3.7sonet, R1 などの最新モデル選択は、Feloの有料プランで利用可能です)
【予想と結果】
青葉賞(GⅡ)

読売マイラーズカップ(GⅡ)

フローラステークス(GⅡ)

【集計結果】
推奨馬4頭の3着内的中率

本命馬◎の3着内的中率

AIモデル 競馬予想比較まとめ
目的
複数の大規模言語モデル(LLM)が提示する競馬予想の成績を評価。
評価指標:的中精度と本命馬の信頼度に関する6指標。
試行レース数を考慮した信頼度補正を行い、総合ランキングを作成する。
データ概要
評価指標(精度指標):
① 推奨4頭中3頭が3着内 (%)
② 推奨4頭中2頭以上が3着内 (%)
③ 推奨4頭中1頭以上が3着内 (%)
④ 本命◎ 1着 (%)
⑤ 本命◎ 2着内 (%)
⑥ 本命◎ 3着内 (%)
分析対象モデル:
ChatGPT (o1/o1 pro/o3 mini/o3/o4 mini)
Gemini (2.0 flash/2.5 pro)
Perplexity
Felo (ResearchAgent/o3 mini/3.7 sonet/R1)
Genspark
Grok
試行レース数:
ChatGPT(o1): n=16
ChatGPT(o1pro): n=13
ChatGPT(o3mini): n=6
ChatGPT(o3): n=7
ChatGPT(o1): n=16
Gemini(2.0flash): n=26
Gemini(2.5pro): n=10
Perplexity: n=29
Felo(o3mini): n=16
Felo(3.7sonet): n=17
Felo(R1): n=11
Genspark: n=12
Grok: n=27
スコアリング設計
重み付け
実務上のリターン価値に基づき、6つの指標に以下の重みを設定。
推奨4頭中3頭 = 4
推奨4頭中2頭 = 3
推奨4頭中1頭 = 1
本命◎1着 = 4
本命◎2着内 = 3
本命◎3着内 = 2
総合スコア
各指標のパーセンテージ (0–100%) を上記の重みで加重平均し、総合スコアを算出。
信頼度調整
各モデルの試行レース数(N)の違いによるスコアのばらつきを抑制するため、ベイズ手法を用いて信頼度補正を行いました。
事前平均 = 35 点、事前レース数 = 10
調整スコア = (総合スコア×N + 35×10)/(N+10)
最終ランキング(調整スコア順)

上位モデルの特徴と実務での使い方
ChatGPT (o1pro)
◎1着率38 %、◎3着内率69 % と単勝・複勝両面で安定。
回収率重視の単勝・ワイド戦略向き。◎を軸に相手2〜4頭へ流す三連複が有効。
Genspark
推奨4頭中2頭以上的中75 %で最多。
ChatGPT (o3 mini)
3着内命中率全項目80 %以上と高精度だがN=6とサンプル不足。
Felo (ResearchAgent)
生データでは最高総合スコア52.9 点だがN=3。過信は禁物。
現状は参考指標として比較材料に留める。
ChatGPT (o4 mini)
3頭的中14 %と決定力は平均超、全体バランス良い。
中波乱想定レースで◎から3連単マルチを組む際のベースモデルに向く。
今後の課題
サンプル拡張:
試行レース数が少ないモデルについて、最低 15 R 程度までデータを追加し、再評価を行う。
【次回】
作成中
