Jevの盤面ゲーム実験:将棋・チェス・五目並べ
Jevを盤面ゲームへ使った公開実験では、合法手の列挙をコードへ任せ、Jevに局面からの選択だけをさせる形が多い。将棋・チェス・五目並べは完全情報ゲームなので、不完全情報ゲームより「Jevの局面判断」と「先読み能力」を切り分けやすい。
将棋の数値と読みの失敗については Jev将棋実験から見る「局所判断」と「読み」の境界 に分離して詳しく整理した。
将棋:弱いStockfishには勝てるが、読みを深くしても安定しない
2026年9月18日の栗林健太郎氏の実験では、Fairy-Stockfishを相手にJevを常に先手として対局させた。Jevには合法手を候補として渡し、駒を取る、成る、王手、詰み、タダ取りされる、別の駒が浮く、相手の1手詰みが生じる、といったルールから機械的に算出できる事実を候補説明へ追加している。
Fairy-StockfishのSkill Levelを -20 / -10 / 0 / 10 / 20 に変えた5局では、-20と-10には詰ませて勝ち、0以上には敗れた。Skill Levelは人間の段級位に換算できないため、「Jevは何級」という結論は出せない。
興味深いのは多段化である。上位6手から相手の応手をJevに予測させる方式、さらに3手先までJev同士で読み進めて局面評価する方式が試されたが、中以上には勝てなかった。予測した相手の応手が実戦と一致したのは、応手読み方式で68手中10手、3手読み方式で70手中12手だった。
ここからは、Jevが「今この手は安全そう」「駒得しそう」といった局所評価を行えても、相手の最善応手を連鎖させる探索器としては弱いことが示唆される。
チェス:Claude 5 Sonnetに5戦全勝という報告はあるが、棋力指標ではない
mizchi氏はJevとClaude 5 Sonnetをチェスで5戦させ、Jevが5戦全勝したと報告している。合法手だけをJevの候補へ渡す一方、比較対象のSonnetは1局あたり約2回、ルール違反の手を選ぼうとしたという。
これは「型付き候補からしか選べないJev」がゲームハーネスと相性が良いことを示す。しかし、StockfishのようなチェスエンジンとのElo測定ではなく、5局という小標本でもある。したがって「Jevはチェスが強い」と一般化するより、生成モデルをそのまま手生成に使うより、合法手Choice型の方が対局を壊しにくかったという証拠として読むのが妥当である。
五目並べ:自己対局を約500ms/手で成立
同じくmizchi氏の五目並べ実験では、15×15盤面で合法な空きマスを候補としてJev同士を対局させた。候補説明には「自分の最長ライン」「相手の最長ライン」「WINS」「BLOCK」など、コードで算出した局所ヒントが含まれる。
公開ログの1局は25手で終了し、判断時間合計は13,913ms。各手は概ね500ms前後だった。これは棋力ベンチではなく、ルールベースの盤面ゲームをJevの連続Choiceだけでリアルタイムに成立させられることのデモと見るべきである。
3事例から見えること
完全情報ゲームでは、Jevの使い方を3層に分けると整理しやすい。
- 合法性: コードが100%保証する。
- 局所的な形の良さ: Jevに任せやすい。
- 深い探索: Jev自身に再帰的に任せるより、通常の探索アルゴリズムを使う方が自然。
とくに将棋実験は、「Jevを多段で呼べば自然にminimaxのような読みになる」とは限らないことを示す。相手の応手予測が外れれば、その先の局面評価がいくら良くても実戦価値を失う。
関連: JevをゼロショットゲームAIとして見る / Jev将棋実験から見る「局所判断」と「読み」の境界 / JevをゲームAIで多段利用する設計 / ゲームAIでJevの確率をどう使うか