牛万鹏
百度Comate研发经理
毕业于吉林大学,现任百度Comate研发经理,负责百度研发智能化,重点推动 AI 原生研发范式在大规模工程体系中的落地,探索以 Coding Agent 为核心的人机协作研发模式。在研发智能化领域申请国内外发明专利10+,工信部重点科研项目『基于大模型技术的工业领域智能化开发工具」核心成员。在此之前分别在百度、Gitee(开源中国)负责DevOps工具的孵化和落地,涵盖项目管理、代码管理、流水线、制品库、应用部署、运维管理等平台建设和商业化。
演讲主题
构建 Coding Agent 的飞轮:Feedback Loop、Benchmark、Agent Engineers
构建 Coding Agent 的飞轮:Feedback Loop、Benchmark、Agent Engineers 随着 Coding Agent 走向真实研发流程,越来越多团队发现问题并不在模型能力,而在于 Agent 难以持续优化:行为不可控、效果不可量化、优化高度依赖少数专家。本次分享将结合实际落地经验,介绍文心快码如何通过 Feedback Loop、Benchmark 与 Agent Engineers 构建一个可运转的 Coding Agent 飞轮。通过工程化的反馈闭环采集 Agent 的真实使用信号,引入贴近生产环境的场景化 Benchmark,对 Agent 行为进行持续评测,并推动研发团队整体转型为 Agent Engineers,使 Agent 的设计、评测与演进成为日常工程活动的一部分。 大纲: 1.背景与问题 - Coding Agent 在真实工程中遇到的三个问题:不可控 / 不可评测 / 不可规模化 - 为什么“模型更强”并不能解决这些问题 2. Feedback Loop:让 Agent 的行为可观测 - 如何采集真实使用反馈,而不是只看显式评分 - 结构化记录 Agent 决策、工具调用和用户采纳行为 2. Benchmark:评测比生成更难 - 通用 Benchmark 与真实研发场景的差距 - 构建场景化、多维度 Benchmark 的实践 4. Agent Engineers:人如何进入飞轮 - 不再区分前后端/算法/平台角色 - 研发人员统一参与 Agent 的设计、评测与优化 5. 飞轮如何跑起来 - Feedback Loop 提供信号 - Benchmark 指导优化 - Agent Engineers 承接持续演进 听众收益: 1. 一套可落地的 Coding Agent 工程实践框架 2. 对 Agent 评测和反馈设计的实战认知 3. 对 Agent 时代研发组织演进的可操作思路