没有人告诉它正确答案,只告诉它这次做得好不好——这就是强化学习。本文用训狗的类比讲清智能体、环境与奖励,解释折扣回报、奖励设计与探索利用两难,并说明它适合哪些现实问题。
核心要点
- 强化学习只给评价不给答案,智能体靠试错摸索策略
- 奖励设计稍有不慎,模型就可能学会钻空子的奇怪行为
- 探索与利用的权衡决定了智能体能否找到更优解
从训狗说起
强化学习(reinforcement learning)的灵感来自动物学习:狗做出坐下动作,你给一块零食,它以后就更愿意坐下。这里有三个要素——做动作的个体、它所处的环境、以及环境给出的反馈,机器学习里分别称为智能体、环境与奖励。
与监督学习不同,强化学习没有人告诉智能体正确答案是什么,只告诉它这次做得好不好。智能体必须通过不断尝试,摸索出一套能长期获得高分的策略(policy)。这种学习方式更接近人和动物适应世界的过程。
奖励、回报与折扣
奖励是即时的,但智能体追求的是长期累积的回报。为了让远期奖励也有价值,同时避免无限累加,研究者引入折扣因子:越晚得到的奖励,折算到当下的权重越低。这很像人类偏好即时满足,折扣因子越大表示越有耐心。
设计奖励是最微妙的环节。如果给清扫机器人按收集到的灰尘量计分,它可能学会先把灰倒出来再吸一遍;如果只按不撞墙计分,它可能学会原地不动。这类钻空子的行为被称为奖励黑客(reward hacking)。
探索与利用的两难
智能体面临一个经典权衡:是继续尝试未知动作以发现更好的选择,即探索;还是重复当前已知最好的动作以稳拿奖励,即利用。只探索则收益不稳定,只利用则可能错过最优解。常用的折中办法是 ε-贪心:多数时候选最优,小概率随机尝试。
另一个关键概念是马尔可夫决策过程(MDP),它为强化学习提供了数学框架:下一刻的状态只由当前状态和动作决定。这个假设虽不完美,却让问题可解。现实中的游戏、调度、推荐场景都可以被近似建模成 MDP。
它擅长什么
强化学习适合动作有长期后果、且可以反复试验的场景,比如下棋、资源调度、机器人控制与芯片布局。它的短板是需要大量交互数据,真实环境试错成本高,因此很多成果先在模拟器里取得,再想办法迁移到现实。
常见问题
强化学习和监督学习最大的区别是什么?
监督学习每一条样本都带着标准答案,模型学习的是输入到输出的映射;强化学习只有好与坏的评价信号,而且这个信号可能延迟很久才出现。因此它必须自己判断哪个动作该为结果负责,这就是所谓的信用分配问题。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。