2026-03-06 01:09:42
AlphaGo Zero是DeepMind开发的围棋人工智能系统,其核心突破在于完全摒弃人类棋谱数据,仅通过自我对弈强化学习实现进化。与依赖3000万盘人类对局数据训练的初代AlphaGo相比,AlphaGo Zero仅使用490万盘自我生成的对局数据,在3天内即以100:0战绩击败此前版本,且硬件配置大幅简化——仅需1台机器与4个TPU,远低于李世石对战版所用的48个TPU。
在输入结构上,AlphaGo Zero采用纯粹的原始棋盘状态(黑子、白子位置)作为神经网络唯一输入,不引入任何人工设计的围棋特征;而早期AlphaGo则融合了由专家提炼的领域知识特征。这一设计使模型真正实现端到端学习,避免人为偏见干扰。
算法架构方面,AlphaGo Zero取消传统蒙特卡洛树搜索(MCTS)中依赖快速随机模拟(走子演算)的评估机制,转而构建高精度单一深度神经网络,同步输出落子策略概率与局面胜率估值。每步决策平均耗时仅0.4秒,兼具效率与准确性,标志着围棋AI从“数据驱动”迈向“原理驱动”的范式转变。
热门推荐
评论区