职责描述
岗位职责(具体工作内容)岗位名称:自动驾驶大模型与强化学习方向实习生岗位亮点:1. 深度参与滴滴深穹远航实验室核心项目,聚焦世界模型、VLA、大模型、强化学习微调及并行训练等前沿技术落地,直面行业前沿挑战;2. 参与关键算法研发,成果优秀可支持发表 CCF A 类顶会 / 顶级期刊论文,助力学术成长;3. 与顶尖技术团队共事,获得一对一导师指导,积累自动驾驶大模型及大规模并行训练实战经验。
核心工作内容1. 负责端到端自动驾驶模型的强化学习微调训练,优化模型在复杂场景下的决策精度与鲁棒性;2. 参与自动驾驶世界模型、VLA 及大模型相关算法研发,开展多模态环境建模、决策推理与规划控制研究;3. 开展自动驾驶模型强化学习大规模并行训练算法研发,提升训练效率、降低资源消耗;4. 参与大模型训练及后训练技术研发,包括监督微调、强化学习微调及相关训练方法优化;5. 参与训练流程的自动化优化,搭建高效、可靠的模型训练与评估体系;6. 跟踪强化学习、世界模型、VLA、大模型及并行计算领域前沿技术,推动算法创新与工程化落地。
任职资格(学历、目标院校、语言、技能、性格等要求)1. 专业背景:自动化、计算机科学与技术、车辆工程、人工智能、机器人等相关专业,本科及以上学历(硕士 / 博士在读优先);2. 技术能力:熟悉强化学习核心算法(如 DQN、PPO、SAC 等),或具备**世界模型、VLA、大模型、多模态学习等相关研究基础;掌握并行系统开发技术(如分布式训练框架、多 GPU / 多节点调度等),有实际项目经验者优先;熟练使用 Python/C++,熟悉 PyTorch/TensorFlow 等深度学习框架;3. 加分项:在 NeurIPS、ICML、ICLR、CVPR、ECCV 等顶会 / 顶刊发表过相关论文;有自动驾驶、机器人强化学习、世界模型、VLA、大模型训练或大规模并行训练项目经验;4. 素质要求:具备较强的问题解决能力、沟通协作能力,对技术研发有浓厚兴趣和钻研精神。5. 实习周期:实习周期:6 个月及以上(可长期实习者优先);工作模式:线下实习,实习地点位于搜狐网络大厦(清华大学东门外);6. 实习福利:表现优秀者可获得校招转正机会;定期团建、专业技能培训资源;论文发表指导与资源支持,助力学术背书。