工作职责:
- 大模型训推框架架构设计与演进:负责大模型训练与推理框架的整体架构设计、技术规划与研发落地,针对MoE、强化学习等模型架构进行训练框架的性能优化,主导多模态等前沿模型训练框架的自研与开源工作,持续提升框架在开源社区及行业内的认可度,承担AI基础设施核心技术建设,保障系统性能优势,支持AI IaaS业务的技术突破
- 大规模推理服务性能优化与降本:负责大模型推理框架及底层引擎的深度优化,深入进行算子优化,提升硬件算力利用率,建设和优化大规模分布式推理系统(包括KV传输与存储系统的设计优化),有效降低用户访问延迟,推动推理引擎与集群调度系统的协同优化,提升集群整体资源利用率,降低模型调用及推理运营成本
- 国产异构算力使能与生态建设:负责万卡规模国产AI芯片集群的大模型训练技术研发,提升系统稳定性和训练性能,对标行业主流旗舰芯片水平,推动国产算力对MoE、多模态、具身智能等前沿领域主流模型的支持与适配,提升模型覆盖率和适配效率,完善相关开发和性能分析工具链,缩短新模型的硬件适配周期,参与建设国产芯片软件生态
任职资格:
- 专业技术能力:具备扎实的AI软硬件结合优化能力,深入理解AI芯片架构、异构计算及大模型训练/推理框架底层原理,在大规模分布式训练、高性能推理服务软件技术、算子研发等领域有丰富的实战经验,具备面向前沿模型架构(如长文本、多模态、MoE等)的技术规划与协同创新能力
- 团队管理能力:具备优秀的团队管理和人才梯队建设经验,能够有效吸引、挖掘和培养优秀技术人才,能够打造技术内聚力强、具备行业影响力的研发团队
- 综合业务素养:具备良好的业务敏感度,能将技术规划与业务目标相结合,推动技术到业务的闭环,具备较强的跨团队沟通协调与推动能力,能有效推进芯片、底层框架与顶层模型研发的协同落地