タラバガニー設計局stalins.clubNOTE/notes/jev-poker-experiment

Jevポーカー実験:GTOとの比較で見える局所直感の限界

Mike Ramos氏は2026年9月17日、No-Limit Texas Hold'emの局面でJevとTexasSolverを比較した。Jevのゲーム判断能力を、GTO solverという明確な参照先と比較した公開例として重要である。

前処理はかなり丁寧

Jevへはテーブル状況、action history、board、hole cards、合法actionなどを渡す。

一方で、

  • pot odds
  • stack-to-pot ratio
  • heroのhand rank
  • outs

など、算術やカード評価で決定できるものはPython側で計算している。

したがってこの実験は、Jevの暗算性能より与えられた戦略情報からactionを選ぶ能力を主に見ている。

30 spotでは63%一致

最初の30 random spotsでは、solverのtop actionとJevのtop actionが63%一致した。

わかりやすい成功例では、J♠T♠で15 outs、必要equity 30%、計算済みequity 33%の局面に対し、

  • solver: call 96%
  • Jev: call 94%

とかなり近い判断をした。

nutsでも4倍pot shove

一方、K♦T♦、board Q♠ 9♦ 4♠ J♥でK-high straight、つまり現時点のnutsを持つ局面では大きく外れた。

pot 22.5bb、残り89.5bbでactionはcheckかall-inのみ。

solverはcheck 100%。

Jevはall-inへ約62%を付け、16回の実行ですべてshoveした。

この局面では「強いhandだから大きくbet」ではなく、弱いhandを降ろし、強いhandにだけcallされる4倍pot shoveを避ける必要がある。Jevはこのrange/EV上の二段階判断をうまく捉えられていない。

相手のflushをカードだけでは認識できなかった例

turnをJ♠へ変え、boardにspadeが3枚ある局面でもJevはshove寄りだった。

さらに相手のhole cardsをそのままstateへ入れ、

  • A♠8♠
  • A♠K♠
  • T♠8♠

のようにflushが完成していることをカードで示しても、「heroがahead」と判断した。

しかし相手handに hand_rank: "Flush, Ace high" と明示するとcheckへ反転した。

これは、カード列から役比較を機械的に導出する処理をJevに期待すべきでないことを示す好例である。

150 spotでの比較

同じsolver treeから150 spotsを評価した結果は以下。

  • Jev 1 question: 全体63%、contested 38%
  • 6 judgments + code: 全体57%、contested 44%
  • regret per action: 全体57%、contested 36%
  • 6 binary facts + code: 全体59%、contested 33%
  • check if legal else call: 全体72%、contested 24%

solverが150中95 spotでcheckを選ぶため、全体一致率はcheck偏重に強く影響される。作者自身もcontested 55 spotsの方を難しい判断の参考として扱っている。

6 judgments + codeは難しいsubsetで38%から44%へ改善したが、万能ではない。

range strategyを理解しているとは限らない

別の局面でsolverはrange全体の71%をbetするのに対し、Jevは39%しかbetしなかった。

具体例を見ると、Jevは

  • 自分のhandが強い → bet
  • 弱い → check

という局所hand-strength寄りの行動をしやすい。

GTOでは、自分の個別handだけでなく、preflopからのrange advantageやbluff/valueの混合が重要になる。

したがってJevのChoice分布をそのままGTO mixed strategyと解釈することはできない。

関連: Jevの不完全情報ゲーム実験:麻雀とポーカー / ゲームAIでJevの確率をどう使うか / JevをゲームAIで多段利用する設計

出典

▸ ノート一覧に戻る