北京RemoteInternshipEntry-levelPosted Today
大模型后训练与GPU/加速器内核优化实习生北京校招实习算法类职位描述面向CUDA及多架构加速器(类CUDA)内核开发的垂直场景,基于现有基础模型开展后训练与评测落地,提升模型在内核生成/改写/性能优化上的实用能力,并在真实业务中落地
1. 构建/清洗面向内核的训练数据与指令模板(生成、优化、注释、性能提示等);
2. 基于SFT、DPO/奖励建模、PPO/RLHF/RLAIF等开展后训练与对齐;
3. 搭建自动化评测闭环:编译-单测-正确性-性能基准与指标(可编译率、通过率、吞吐/延迟、寄存器/共享内存、occupancy等);
4. 集成编译/分析/运行工具,将静态/动态性能信号引入训练反馈。职位要求1. 硕士/博士在读,大模型方向;
2. 至少一种LLM后训练实践(SFT或RLHF/RLAIF/奖励建模/DPO等),重视训练-评测落地能力,有coding方向经验加分;
3. 熟悉PyTorch与数据处理,能搭建训练/评测流水线;了解分布式/混合精度者优先;
4. 具备CUDA/GPU并行基础,能阅读/编写内核并定位性能瓶颈;熟悉nvcc/clang与profilers等工具;
5. 工程能力扎实(Python优先,C/C++加分),自驱与协作良好。
加分项
1. 有CUDA/HIP/SYCL或其他加速器内核优化经验;搭建过编译-运行-打分闭环;
2. 在算子优化/并行计算/系统性能工程方面有积累;有开源、论文或竞赛经历。投递
