工作职责:
-参与百度 PSIG 统一评估中台建设,协助支持文库、网盘等核心业务场景下的 AIGC 能力评估工作
-协助整理和维护评估任务、评估数据、评估指标及评测流程,参与沉淀标准化评估方法和工具
-基于 Agent Skills、Prompt、RAG、Tool Use 等技术,协助搭建和优化自动化测评智能体,支持对不同 AIGC 业务能力的评估验证
-参与多模型、多任务、多场景的评测实验,完成实验配置、结果收集、数据分析和报告整理等工作
-协助研发同学进行 Agent 相关能力的调研与实验,包括长期记忆、推理链路、多智能体协作、Agentic Workflow 等方向
-参与评估框架和工具链的日常开发与维护,协助完成评测脚本、数据处理脚本、可视化分析工具等模块建设
-跟进大模型、智能体、多模态评估等前沿技术进展,参与技术调研、竞品分析和内部分享
任职资格:
-计算机、人工智能、软件工程、自动化、数学、信息安全等相关专业本科及以上在读,具备较扎实的编程基础
-熟悉 Python 编程,能够独立完成数据处理、脚本开发、接口调用、实验分析等基础研发工作
-了解大模型基本概念,如 Prompt、RAG、Agent、Tool Use、Function Calling 等,有相关项目或课程实践经验者优先
-对智能体、AIGC、LLM 应用、模型评估等方向有兴趣,具备较强的学习意愿和技术好奇心
-了解常见机器学习、深度学习基础知识,有模型训练、推理、评估或数据分析经验者优先
-具备良好的逻辑思维和问题拆解能力,能够在导师指导下完成实验设计、结果分析和问题定位
-具备良好的沟通能力和团队协作意识,能够清晰记录实验过程、整理评估结论,并与研发、产品等角色协同推进工作
-使用过 LangChain、Opencode、Dify、Coze 等 Agent 或 LLM 应用开发框架
-参与过大模型评测、Prompt 优化、RAG 系统、智能体工具调用等相关项目
-有文本、图像、视频、音频等多模态数据处理或评估经验
-熟悉 Git、Linux、API 调用、数据标注或自动化测试流程