2026-03-07 09:36:18
AlphaGo Zero是DeepMind公司研发的围棋人工智能程序,代表了人工智能在围棋领域的重要突破。该程序不依赖任何人类棋谱或先验知识,仅通过围棋规则和自我对弈进行强化学习,在40天内完成3000万局训练,最终超越此前所有AlphaGo版本。
与早期AlphaGo相比,AlphaGo Zero采用单一神经网络结构,统一完成落子选择与胜率评估,摒弃了旧版中分离的策略网络与价值网络设计。同时,它取消了快速走子(rollout)机制,转而依靠高精度神经网络直接评估局面,显著提升计算效率与决策质量。
AlphaGo Zero在训练初期即展现出类人学习路径:最初模仿初学者贪吃棋子,三天内掌握复杂战术,重新发现包括定式、厚薄、全局观在内的数千年围棋核心知识体系。其100:0击败前代AlphaGo的战绩,印证了纯自主学习范式在高度抽象策略游戏中的可行性与优越性。
热门推荐
评论区