Jevポーカー実験:GTOとの比較で見える局所直感の限界
Mike Ramos氏は2026年9月17日、No-Limit Texas Hold'emの局面でJevとTexasSolverを比較した。Jevのゲーム判断能力を、GTO solverという明確な参照先と比較した公開例として重要である。
前処理はかなり丁寧
Jevへはテーブル状況、action history、board、hole cards、合法actionなどを渡す。
一方で、
- pot odds
- stack-to-pot ratio
- heroのhand rank
- outs
など、算術やカード評価で決定できるものはPython側で計算している。
したがってこの実験は、Jevの暗算性能より与えられた戦略情報からactionを選ぶ能力を主に見ている。
30 spotでは63%一致
最初の30 random spotsでは、solverのtop actionとJevのtop actionが63%一致した。
わかりやすい成功例では、J♠T♠で15 outs、必要equity 30%、計算済みequity 33%の局面に対し、
- solver: call 96%
- Jev: call 94%
とかなり近い判断をした。
nutsでも4倍pot shove
一方、K♦T♦、board Q♠ 9♦ 4♠ J♥でK-high straight、つまり現時点のnutsを持つ局面では大きく外れた。
pot 22.5bb、残り89.5bbでactionはcheckかall-inのみ。
solverはcheck 100%。
Jevはall-inへ約62%を付け、16回の実行ですべてshoveした。
この局面では「強いhandだから大きくbet」ではなく、弱いhandを降ろし、強いhandにだけcallされる4倍pot shoveを避ける必要がある。Jevはこのrange/EV上の二段階判断をうまく捉えられていない。
相手のflushをカードだけでは認識できなかった例
turnをJ♠へ変え、boardにspadeが3枚ある局面でもJevはshove寄りだった。
さらに相手のhole cardsをそのままstateへ入れ、
- A♠8♠
- A♠K♠
- T♠8♠
のようにflushが完成していることをカードで示しても、「heroがahead」と判断した。
しかし相手handに hand_rank: "Flush, Ace high" と明示するとcheckへ反転した。
これは、カード列から役比較を機械的に導出する処理をJevに期待すべきでないことを示す好例である。
150 spotでの比較
同じsolver treeから150 spotsを評価した結果は以下。
- Jev 1 question: 全体63%、contested 38%
- 6 judgments + code: 全体57%、contested 44%
- regret per action: 全体57%、contested 36%
- 6 binary facts + code: 全体59%、contested 33%
- check if legal else call: 全体72%、contested 24%
solverが150中95 spotでcheckを選ぶため、全体一致率はcheck偏重に強く影響される。作者自身もcontested 55 spotsの方を難しい判断の参考として扱っている。
6 judgments + codeは難しいsubsetで38%から44%へ改善したが、万能ではない。
range strategyを理解しているとは限らない
別の局面でsolverはrange全体の71%をbetするのに対し、Jevは39%しかbetしなかった。
具体例を見ると、Jevは
- 自分のhandが強い → bet
- 弱い → check
という局所hand-strength寄りの行動をしやすい。
GTOでは、自分の個別handだけでなく、preflopからのrange advantageやbluff/valueの混合が重要になる。
したがってJevのChoice分布をそのままGTO mixed strategyと解釈することはできない。
関連: Jevの不完全情報ゲーム実験:麻雀とポーカー / ゲームAIでJevの確率をどう使うか / JevをゲームAIで多段利用する設計