大模型AI Infra平台研发工程师
  • 招聘类别:
  • 社会招聘
  • 工作性质:
  • 全职
  • 薪资范围:
  • 面议
  • 招聘人数:
  • 1
  • 发布时间:
  • 2026-09-14
  • 截止时间:
  •  
  • 工作地点:
  • 北京市

工作职责:

-参与超大规模的AI Infra平台架构设计与研发,统一承载预训练、Midtrain、SFT、RL 场景,打通数据版本、代码、镜像、配置、资源与产物,实现全程可观测、可追踪。统一训练指标、系统指标、日志、资源与评估结果视图,支撑实验归因、故障归因、性能与成本分析
-基于 Kubernetes、Ray 等技术栈,设计大规模异构资源调度体系,提供拓扑感知、配额抢占、细粒度容错、弹性扩缩容、长任务恢复、异常对账、灰度回滚等能力,保障超大规模训练任务稳定运行
-建设 Agent 友好的 API 与工作流,统一自然语言、表单、YAML、CLI 的实验与执行语义;探索参数补全、任务编排、故障诊断与受约束自动化实验迭代
-独立完成复杂问题拆解、方案设计、上线验证与复盘改进,推动多团队达成接口、排期与验收共识,识别架构演进与技术债风险并沉淀工程机制


任职资格:

-本科及以上学历,计算机、软件工程、人工智能或相关专业;3 年及以上分布式系统、云原生平台、AI Infra 或大模型训练平台研发经验
-熟练掌握 Go、Python、C++、Java 中至少一种语言,能独立完成生产级系统的设计、编码、测试、上线与运维
-具备在大数据处理系统Ray/Spark、分布式系统Kubernetes上构建AI平台的经验
-对大模型一站式实验平台(MLOps/LLMOps)平台建设有深入了解,掌握数据版本管理、实验追踪、模型中心、推理部署、模型评估等模块的技术细节
-具备 Agent 工具调用、MCP/Skill、长期任务状态、评估与回放、Memory 或 Auto Research 相关实践经验
-具备较强的抽象与系统设计能力,能从用户目标出发定义对象、边界、接口与验收指标;具备良好的 Ownership 与跨团队推动能力,自驱力强,敢于攻坚复杂系统问题

©2026  百度昆仑芯定制网申   京ICP备05051632号-16 京公网安备 11010802032024号隐私政策 Powered by