深圳Full TimePosted Today
强化学习算法工程师-2027届AI深圳正式互联网 / 电子 / 网游职位描述本岗位聚焦于金融垂类大模型的后训练与智能体应用,核心使命是利用强化学习(RL)技术实现智能体行为的深度优化与价值观对齐,并优化其在智能体系统中的表现。你将主导从金融环境模型构建、RL智能体训练到Harness/Loop闭环搭建的全链路研发,确保大模型在金融高敏场景下具备极高的可靠性、安全性与可控性。
岗位职责:
1、金融大模型强化对齐研发:负责金融场景下的Agent RL后训练开发,主导环境模型(Environment Model)设计与Agent RL训练(涵盖PPO、GRPO等算法),完成模型调优与业务落地,全面提升模型的有用性、安全性及金融专业推理能力。
2、决策场景策略优化:针对金融对话、量化交易及投资决策等场景,构建基于强化学习的策略优化框架,自主搭建智能体Harness/Loop系统,通过AI技术与业务的深度融合,显著提升核心业务指标。
3、前沿对齐技术探索:追踪并应用世界模型(World Model)、Agentic RL等前沿技术,探索高效、轻量的训练路径,降低计算成本,提升模型迭代效率。
4、评估体系与数据闭环:设计并迭代环境与奖励建模体系,结合人工反馈与自动化指标,构建可量化的模型行为评估闭环,驱动智能体技能的持续进化。
5、技术创新与落地:紧跟强化学习与大模型智能体领域的学术前沿,探索以可扩展的方式推动技术创新在金融场景中的规模化应用。职位要求1、学历背景:硕士及以上学历,计算机科学、人工智能、自动化、应用数学、统计学等相关专业。
2、理论基础:深入理解强化学习核心算法(PPO、DQN、策略梯度等);熟悉大模型后训练范式(SFT、RLHF、DPO、GRPO)及智能体Harness/Loop的构建原理。
3、工程能力:精通Python,熟练掌握PyTorch或JAX(有JAX实战经验者优先);具备优秀的工程落地能力,能独立完成从模型训练调优到智能体系统搭建的全流程开发。
4、项目经验:具有大模型微调或RL训练的实际项目经验(含实验室研究或实习经历);熟悉主流RL训练框架(如VERL、TRL、OpenRLHF等);具备基于Agent框架(如Pi-Agent、OpenAgent等)搭建智能体系统并解决实际业务问题的能力。
加分项:
1、在NeurIPS、ICML、AAAI等顶级会议发表过RL或LLM相关论文;
2、具备奖励模型设计、偏好数据构建或线上策略优化经验;
3、拥有金融智能体系统的搭建与部署经验,或对金融市场有深刻理解和浓厚兴趣。投递
