Back to Jobs
北京智谱华章科技有限公司

【智谱星】AI院-多模态理解-算法工程师(26届校招)

北京智谱华章科技有限公司
北京RemoteFull TimeSeniorPosted Today
【智谱星】AI院-多模态理解-算法工程师(26届校招)北京正式互联网 / 电子 / 网游职位描述【团队介绍】 智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。 团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。 顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。 【岗位职责】 技术方向一:学科解题方向,负责VLM的混合SFT/RL训练优化及RL训练的数据处理; 技术方向二:reward 方向,负责 reward system 和 verifier model 优化; 技术方向三:负责VLM的算法开发和预研,需具备较强的算法自主研究能力(智谱星); 技术方向四:多模态训练框架开发、调优、提速; 技术方向五:负责 pretrain 训练数据清洗优化工作; 技术方向六:负责多模态智能评估方向。职位要求【职位要求】 1. 2026届毕业,自然语言处理、机器学习、人工智能、软件工程等相关专业,硕士及以上学历; 2. 较强的算法开发能力,熟悉常用的机器学习、深度学习算法; 3. 熟练运用Pytorch、transformers、megatron等主流框架; 4. 对Transformer的架构有较为深入的理解,了解Transformer的各种变体,有相关的研究经验者优先; 5. 具备优秀的代码能力和基础算法功底,有较为丰富的工程经验,有大规模训练经验或大规模数据处理经验。 加分项: 1. 在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先; 2. 熟悉并行训练框架,有多机多卡训练经验者优先。投递
Ready to apply? You'll be taken to 北京智谱华章科技有限公司's application page.
【智谱星】AI院-多模态理解-算法工程师(26届校招) at 北京智谱华章科技有限公司