工作职责:
-负责大规模AI计算集群(十万卡级GPU)的AI研发平台和异构计算底座设计与研发,实现算力的极致利用与全流程效率的提升
-构建异构多芯计算平台,建设与优化GPU虚拟化,智能超发、在离线混布等能力,实现算力供给的 Serverless 化
-基于Kubernetes生态,研发云原生AI组件,设计面向多场景(开发、训练、推理等)的异构计算平台产品与解决方案
-打通AI存储、高性能网络、Sandbxo等周边生态,持续演进系统架构 ,保障大规模集群的稳定性、性能与可扩展性
任职资格:
-计算机相关专业本科及以上学历,2年以上后端/基础设施开发经验
-熟悉Kubernetes原理及开发,包括调度器、Device Plugin、CRI、CNI等机制
-熟练掌握Go/Python/C++中至少一门语言
加分项(满足任一即可):
-有GPU集群、HPC、AI Infra相关经验
-熟悉Kubeflow、Volcano、Ray等AI编排框架
-了解GPU架构(CUDA、NVLink、InfiniBand)
-有大规模分布式系统设计经验
-具备独立定位和解决复杂系统问题的能力,注重工程质量