这是一个围绕 掼蛋游戏规则、图形界面、规则 AI、强化学习训练与评估 的 Python 项目。 当前强化学习部分已经从旧版 Q(s, action_index) 重构为 Action-Conditioned Double DQN:网络不再学习“第几个合法 ...