研一方向是多智能体强化学习,发现用的算法像是PPO,SAC,TD3都是好几年前的东西,多智能体强化学习的算法和单智能体强化学习的算法整体框架也都相近。也没听说deepmind和openai最近在决策智能这块有什么动作
强化学习最近是不是没有什么突破了?
来源:知乎热榜
2026年09月13日 10:01
0 阅读
分享到: