導入事例 - 癞子斗地主 AI:複雑な行動空間への拡張
DouZero の研究と実装をワイルドカードルールへ拡張し、合法手生成、状態表現、行動符号化、方策評価を再設計しました。
- クライアント
- 匿名のゲーム AI スタートアップ
- 支援領域
- ゲーム AI / 強化学習 / 意思決定システム
- 不完全情報
- 自己対戦
- 行動空間
- ワイルドカード
- 方策評価
ルール変種の難しさ
斗地主は三人対戦、協力と競争、不完全情報、巨大で動的な行動空間を含みます。ワイルドカードにより組み合わせがさらに増え、重複手や無効手も発生しやすくなります。
モデルは実際のカードと置換後の意味を同時に保持し、将来の手札構造、味方との協力、相手への圧力まで評価する必要があります。
ソリューション
DouZero の論文と実装を分析し、大規模行動空間と自己対戦の長所を残しながら、ルール依存モジュールを再構築しました。
ワイルドカード牌型列挙、合法手生成、正規化・重複排除、状態符号化、行動特徴、推論連携、方策評価まで対応しました。
モデル改善
自動自己対戦と実対局分析から、入札、手札分割、ワイルドカード温存、相手抑制、味方支援、終盤処理の弱点を特定しました。
静的なベンチマークだけでなく、結果をルール生成、状態表現、学習、評価へ継続的に反映しました。
成果
ワイルドカードルール下で安定した意思決定を行い、クライアントの実運用版で人間の上級者に近い水準を達成しました。
この方法は、巨大な状態空間、動的な合法手、遅延報酬、複数エージェントを持つ他の意思決定問題にも応用できます。