我研三时候为了给老板的一个项目水一篇论文,开始研究强化学习,当时这个工具还没像现在一样在优化领域烂大街,我也是自己无意间发现的。甚至我毕业答辩在座的老师都不太有人听过,那时候也没有大模型,所有东西都靠自己啃,我从MDP啃到策略优化,我们组是个偏硬件工程的团队,所以也没人带。当时连神经网络都不会搭,就这样慢慢啃了下来也带给了我在RL方面的深刻理解(基础理论我基本能随手推导)
在那段时间我在知乎上看到一个帖子,说做一个极端的假设这个世界是个巨大的MDP那么如果能观察所有的状态,训练的足够多就能预测未来。然后我就在思考其实人所有的学习行为就是观察-行动-反馈-更新的。然后对这个理论研究越深入就越会用MDP的思想看待自己的行为,所以到底是AI在模仿人类还是人类在模仿AI
发布于 陕西
