AI Agent 从零到上生产的可观测体系与自进化飞轮
亚马逊云科技资深解决方案架构师。硕士毕业于 Erasmus Mundus IMMIT 经济与 IT 管理专业。自 2006 年起,先后以研发工程师、数据工程师、解决方案架构师身份在 SonyEricsson、SAP SE、Alibaba Cloud、Tencent Cloud 等多家跨国企业从事 IT 相关工作超过 15 年,积累了丰富的跨行业技术实践经验。目前专注于帮助客户在云上构建优雅的解决方案,核心技术方向包括微服务架构、可观测性、AIOps 与 AgentOps。致力于将前沿学术成果与工程实践相结合,推动企业级 AI Agent 系统从 POC 走向可靠的生产落地。
议题背景:
89% 的 Agent 项目死于生产环境——不是模型不够强,而是缺少一个持续旋转的闭环来校准它。本 session 提出 Gödel Agentic Flywheel:一套将 AgentOps 方法论工程化为 Observe → Evaluate → Optimize → Govern 持续闭环的实践框架,并赋予其哥德尔递归性——飞轮不仅改进 Agent,还能改进自身的改进逻辑。
理论基础融合 Compound AI Systems(复合系统观)、Antifragility(反脆弱性)、Cybernetic Feedback Loop(控制论闭环)与 Evolutionary Architecture(演进式架构),并引用 2026 年最新学术成果:SARSI 递归自改进框架、MetaSkill-Evolve 双时间尺度元技能演进、AgentOps Automation Pipeline 六阶段自动化模型 等 7 篇前沿论文。
AWS 服务在飞轮中承担关键角色:Amazon Bedrock AgentCore(Runtime / Identity / Policy / Gateway / Memory / Evaluations / Observability / Optimization)构建飞轮引擎;Amazon CloudWatch Omni for Agents 提供 IDE-first 的 Agent+Infra 联动可观测、managed evaluators 与 A/B experiment 能力,实现从本地开发到生产的全链路闭环优化。
本方案已在多个大客户中验证落地,覆盖智能硬件、家电、生命科学、金融等行业的头部企业——从 AgentCore Evaluation & Observability 打法,到多租户 Agent 平台的观测隔离与合规,再到高风险场景的四象限全覆盖方案。从 Level 1 手动飞轮 到 Level 4 全自动 Gödel 飞轮,为你提供可复制的企业级 Agent 自进化路线图。我们将结合 Live Demo 演示 Strands / Claude Agent SDK 等不同 Agent 框架如何落地。
内容大纲:
1. Why 89%: Agent 项目死在生产的真正原因
1.1 非确定性系统的三个失败模式:drift、tool 幻觉、reasoning cascade
1.2 传统 MLOps 为什么救不了 Agent:静态模型 vs. 有状态多步执行体
1.3 三个真实事故复盘(客服 Agent / 医疗 Agent / 交易 Agent)
2. Gödel Agentic Flywheel:理论基础
2.1 复合 AI 系统(Compound AI Systems)作为分析单元
2.2 Antifragility:从"抗故障"到"以故障为食"
2.3 Cybernetic Feedback Loop 与 Evolutionary Architecture
2.4 哥德尔递归性:为什么飞轮要能改进自己的改进逻辑
2.5 引用的 7 篇 2026 前沿论文速览(SARSI / MetaSkill-Evolve / AgentOps Automation Pipeline 等)
3. 飞轮四象限:Observe → Evaluate → Optimize → Govern
3.1 Observe — traces / tokens / tool calls / reasoning chain 的最小采集集
3.2 Evaluate — LLM-as-judge、Golden Set、Human-in-the-loop 的取舍
3.3 Optimize — Prompt / Model / Tool topology / Memory 四类可优化面
3.4 Govern — Identity、Policy、Guardrail、Audit 的分层部署
3.5 四象限之间的信号契约与数据流
4. AWS 飞轮引擎:AgentCore + CloudWatch Omni
4.1 AgentCore 八件套映射到飞轮的四个象限
4.2 CloudWatch Omni for Agents:IDE-first 的开发期可观测
4.3 Managed Evaluators 与 A/B Experiment:从本地跑分到线上灰度
4.4 一份 traces 三处复用:调试、评测、优化
5. 成熟度模型 Level 1 → Level 4
5.1 Level 1 手动飞轮:人评 + 静态基线
5.2 Level 2 半自动:eval 集自动化、告警驱动优化
5.3 Level 3 自动优化:Prompt/Tool 拓扑自动搜索
5.4 Level 4 Gödel 飞轮:飞轮改进自身评测标准与优化策略
5.5 每一级的组织、KPI、投入产出
6. 大客户实证与落地
6.1 智能硬件与家电行业多家头部客户 — AgentCore Evaluation & Observability 打法
6.2 生命科学行业头部客户 — 多租户 Agent 平台的观测隔离与合规
6.3 金融行业头部客户 — 四象限全覆盖:从客服到风控的分层飞轮
6.4 三段客户旅程图与"从 Level N 到 Level N+1"的关键决策
7. Live Demo:不同框架落地飞轮
7.1 Strands Agents 的埋点与评测接入
7.2 Claude Agent SDK 的 Trace 输出与 CloudWatch Omni 联动
7.3 同一 eval 集跑三个框架的对比可视化
7.4 触发一次 Prompt 优化 → 灰度 → 回滚全链路
8. 关键收益与下一步
8.1 Takeaway:可复制的企业级自进化路线图(模板下载)
8.2 常见反模式与陷阱清单
8.3 Q&A
听众收益:
1. 能够画出自己的 Agent 项目当前处在飞轮的哪一个 Level
2. 拿到一份可直接套用的 Observe / Evaluate / Optimize / Govern 信号契约模板
3. 理解 AgentCore + CloudWatch Omni 的具体接入路径
4. 看到 Strands / Claude Agent SDK 在同一飞轮下的实测差异
5. Positioning 与差异化(对内说明)
6. 面向 Agent Builder,问题陈述从"生产死亡率"切入,学术引用 + 框架 demo 是这个场次的差异点
7. 竞品往往只讲 AgentCore 单一产品或某一个框架;本 session 提供的是理论—方法—产品—落地贯穿的完整叙事
8. 与 re:Invent 2026 COP302/303/318/325 相比,本 session 提出的是方法论抽象层,而不是产品 how-to