北京Full TimePosted Today
数据闭环 · 表征模型算法工程师北京全职通用智能板块职位描述1、基于模型产出的表征做聚类、相似检索、分布与结构分析等数据挖掘,融合多维信息洞察数据规律,反哺trigger与数据策略;
2、定义高质量数据标准并指导数据生产,根据不同模型在不同阶段(如基础能力构建、短板修复、泛化性提升等)的关键需求,明确高质量数据的特征(多样性、代表性、稀缺性、真实性等),指导数据采集工作,保障模型训练效果;
3、研究长尾 / 异常 / 覆盖等数据问题的建模方法,支撑数据筛选、去重与多样性优化;
4、跟进前沿(表征学习、多模态大模型 / VLM、世界模型、数据中心化 AI),快速将新方法引入并验证收益;
5、研发多模态表征 / embedding 模型:模型选型、训练与微调、蒸馏与优化,持续提升表征质量与泛化能力;
6、探索自监督 / 对比学习 / 多模态对齐等表征学习方法,并结合业务场景迭代。职位要求1、计算机 / 人工智能 / 数学统计等相关专业,本科及以上;
2、有 embedding / 表征模型相关研发经验(训练、评估或落地);
3、熟练 Python + PyTorch,能独立完成模型实验到工程落地;
4、掌握常用聚类、降维、ANN 检索、密度 / 分布分析等方法,能从表征中挖掘结构与规律,数据敏感度好;
5、具备处理大规模数据的能力与意识(效率、可扩展);
6、扎实的深度学习功底,熟悉表征学习 / 对比学习 / 多模态建模等,理解模型训练与调优;
7、工作踏实认真、责任心强,能独立推进并沉淀方法论。
加分项
1、了解数据分布诊断、长尾 / 覆盖 / 多样性度量、子群挖掘等;
2、有自动驾驶 / 大规模数据闭环背景;
3、有高质量论文、竞赛或开源成果者优先。
我们看重的特质
1、对新技术充满热情,能快速学习并落地前沿模型方法;
2、严谨务实,重视模型效果与结果的可验证性;
3、好奇心强、善于从数据与模型中发现并解决问题。投递
