路径规划:无人机与扫地机器人怎么找路
要从 A 点走到 B 点,先得知道哪里能走。本文讲清 SLAM 如何边走边建图,Dijkstra 与 A* 如何搜索最短路径,配置空间与全局局部两层规划如何应对真实世界,以及学习方法…
强化学习、具身智能、人形机器人与自动驾驶中的决策技术。
要从 A 点走到 B 点,先得知道哪里能走。本文讲清 SLAM 如何边走边建图,Dijkstra 与 A* 如何搜索最短路径,配置空间与全局局部两层规划如何应对真实世界,以及学习方法…
自动驾驶被拆成感知、预测、决策规划三级阶梯,每秒运转数十次。本文讲清摄像头、毫米波雷达与激光雷达如何互补,鸟瞰图表示有什么用,以及为什么量产车大多是仍…
世界是为人设计的,这是造人形机器人的核心理由,但双足行走天生不稳定、手部精细操作更难,硬件与安全同样是硬约束。本文逐项拆解人形机器人从实验室演示走向量…
只见过文字描述“杯子易碎”的系统,与亲手摔碎过杯子的系统,理解深度并不相同。本文解释具身智能的核心主张、身体带来的约束与免费监督、感知到控制的技术栈,…
游戏里日夜对局上亿次,现实中一次失误就可能损坏设备。本文剖析强化学习走向现实的四道坎:样本效率、仿真到现实的鸿沟、奖励设计与安全可解释性,并给出工业界…
围棋局面多到无法穷举,AlphaGo 却用搜索加学习的组合攻克了它。本文解释蒙特卡洛树搜索如何在有限算力下聚焦有希望的分支,以及策略网络与价值网络各自解决了什么…
如果知道每个动作未来能拿多少分,决策就只需挑最高的。本文讲清 Q 学习如何用时间差分修正这张打分表,深度 Q 网络怎样用神经网络替代表格,以及经验回放与目标网…
没有人告诉它正确答案,只告诉它这次做得好不好——这就是强化学习。本文用训狗的类比讲清智能体、环境与奖励,解释折扣回报、奖励设计与探索利用两难,并说明它…