工作职责:
-建设稳定、可复用的通用平台服务与面向大模型全生命周期的可靠运行平台。核心支撑身份、权限、配置、资源等基础能力,并参与大模型数据治理、自动化评估体系及分布式调度能力的建设,提升资源利用率、模型迭代效率与运行隔离能力
-平台架构与服务建设: 负责平台后端服务(身份、权限、配置、资产等)的设计、开发与持续优化;设计可扩展的数据模型、服务接口及异步处理流程,保证数据一致性与可追溯性
-基础模型评估与 Benchmark 平台: 主导大模型训练/推理数据的全链路治理(采集、清洗、版本管理及高效传输);搭建自动化评估基础设施,设计并维护覆盖通用能力、代码、数学及安全性等维度的 Benchmark 体系;攻克可验证任务评测等核心工程难题,为模型迭代提供精准、可复现的量化依据
-分布式调度与资源管理: 负责任务编排、队列、优先级、配额、抢占及生命周期管理;设计并实现基于容器的任务运行、资源分配、节点调度和隔离机制,支撑大规模并发任务下的容量规划与故障迁移
-高并发与通用难题攻坚: 处理高并发、限流、幂等、缓存、消息、容灾和多租户等通用平台问题;参与多集群、异构资源(如 GPU)、弹性伸缩和成本优化等平台能力演进
-工程规范与稳定性保障: 完善自动化测试、技术文档、监控告警体系;建立调度与运行链路的追踪、审计工具,具备从日志、指标和运行时状态快速定位线上问题的能力,推动团队代码质量与工程规范的落地
任职资格:
-经验与语言: 4 年以上后端或平台研发经验,具备独立负责模块或服务的经验;熟练掌握 Go 或 Python 中至少一种,熟悉 REST/gRPC 等服务接口设计
-云原生与底层原理: 深入理解操作系统、网络、容器运行时及分布式系统原理;熟悉 Linux 和容器化开发,有 Kubernetes 生态(如控制器开发、CRD)或云原生服务治理经验
-AI 工程化与数据/评估: 具备大模型数据平台或评估平台的建设经验;了解主流评估基准与自动化评测工具链
-中间件与数据一致性: 熟悉关系型数据库、缓存、消息系统和对象存储,深刻理解索引、事务、并发和一致性原理;具备处理并发、状态机、事件幂等、租约、超时和故障恢复问题的实战经验
-工程素养: 具备良好的编码习惯、严格的代码审查(Code Review)意识、测试意识以及优秀的团队沟通能力
-有 Kubernetes 生态、GPU/异构资源调度、作业调度、多集群或高性能计算平台(HPC)经验。有制品/数据平台、权限与多租户、开发者平台、开放 API 或大规模分布式服务经验。熟悉安全隔离、微虚拟机技术,或有大规模集群资源利用率提升、任务吞吐量优化的可量化成果