上海Full TimePosted 14d ago
机器人端侧模型运行与性能工程师上海全职互联网 / 电子 / 网游职位描述岗位介绍
-负责机器人端侧/边缘侧多模态模型运行系统的设计、开发与性能优化,将 LLM、VLM、Omni、ASR、TTS 等模型转化为可稳定运行、可双向流式调用、可低时延中断和可观测的系统级推理能力。
-你将重点参与原生多模态模型的组件拆分、轻量化适配、端云分层运行、双向流式 API 和运行时资源治理,为机器人实时交互系统建设低延迟、高可靠的模型运行底座。
-本岗位聚焦 Model Runtime、Inference Backend、Realtime Streaming 和 Performance Engineering,不同于常规模型转换或部署脚本开发,不负责上层 Agent 业务编排和机器人交互状态机。
岗位职责
1. 建设端侧多模态模型运行系统
负责 LLM、VLM、Omni、ASR、TTS 等模型的统一接入与稳定运行,完成模型拆分、轻量化适配、端云分层部署和推理引擎构建。
2.建设双向流式推理 API
基于 gRPC 双向流、WebSocket 等协议,支持音频、视频、文本流式输入和文本、语音增量输出,并管理 Session、Deadline、序列一致性和流量反压。
3. 建设模型流式中断能力
实现 Streaming Infer、Cancel、Abort 和 Timeout,支持用户插话时快速停止模型生成及音频输出,并保障 Buffer、队列和 KV Cache 等运行时资源状态一致。
4. 负责推理后端适配与性能优化
适配 TensorRT、TensorRT-LLM、vLLM、SGLang、ONNX Runtime 及厂商 NPU/DSP 工具链,开展模型导出、量化、精度对齐和性能优化。
5. 建设资源调度、性能与稳定性闭环
优化多模型资源分配和音视频数据通路,建立 TTFT、首音频输出延迟、Audio-to-Audio Latency、Cancel 响应时延及 P95/P99 等性能基线,完善 Trace、自动化回归和长稳测试,并支持真实机器人联调与 Demo 交付。职位要求1. 本科及以上学历,计算机、软件工程、人工智能、电子信息、自动化、高性能计算等相关专业优先。
2. 具备 3 年以上 AI 推理系统、端侧模型运行、高性能计算、异构计算、实时音视频、机器人软件、智能座舱或大模型基础设施相关经验。
3. 熟练掌握 C++,具备良好的 Python 和 Linux 开发、调试及性能分析能力。
4. 在以下两个方向中,至少一个方向具备深入项目经验,并对另一方向有完整理解:
* 模型推理 Runtime、推理后端、模型服务或端侧运行系统;
* 双向流式协议、实时音视频、异步网络或低延迟流式系统。
5. 熟悉 TensorRT / TensorRT-LLM、vLLM / SGLang、ONNX Runtime、Triton、CUDA 或厂商 NPU/DSP 工具链中的至少一种。
6. 理解 Transformer、LLM、VLM 或 Omni 模型的基本推理流程,熟悉 Prefill / Decode、KV Cache、Streaming Generation 和动态/静态 Shape 等概念;具备多线程、异步任务、内存管理和性能 Profiling 能力。
加分项
1. 有 Qwen-Omni 或类似原生多模态、Any-to-Any、端到端语音交互模型的拆分、流式推理或端云分层运行经验。
2. 有 gRPC 双向流、WebSocket、RTC、Realtime API 或流式 SDK 设计经验。
3. 有请求级 Cancel、原生流式中断、Session 资源隔离、KV Cache 回收或 Deadline 管理经验。
4. 有 Jetson Orin、Thor、高通 SoC、地平线、昇腾等边缘 AI 平台的模型运行和性能优化经验。
5. 熟悉 FP8 / INT8 / INT4 量化、CUDA Kernel、TensorRT Plugin、计算图优化,或有机器人、智能座舱、自动驾驶等真实端侧项目交付经验。投递
