专场出品人:
......
......
Agent Infra与AgentOps
专场定位:Agent大规模部署运行的基础设施、运维体系与成本治理。

内容覆盖维度:
▪ Agent基础设施:运行时环境、调度引擎、弹性伸缩与资源编排
▪ Agent原生云架构:Agent Native Cloud的设计理念与工程实践
▪ Agent可观测性:分布式Agent的追踪、日志、指标与调试
▪ Token经济学与FinOps:Token成本优化、预算控制、模型路由策略
▪ 从POC到生产的工程化挑战:可靠性、延迟、成本与规模化运维
徐为(Yagr Xu)
黄梓航
AI Agent 从零到上生产的可观测体系与自进化飞轮
亚马逊云科技 资深解决方案架构师
亚马逊云科技 资深 AI 产品解决方案架构师
亚马逊云科技资深解决方案架构师。硕士毕业于 Erasmus Mundus IMMIT 经济与 IT 管理专业。自 2006 年起,先后以研发工程师、数据工程师、解决方案架构师身份在 SonyEricsson、SAP SE、Alibaba Cloud、Tencent Cloud 等多家跨国企业从事 IT 相关工作超过 15 年,积累了丰富的跨行业技术实践经验。目前专注于帮助客户在云上构建优雅的解决方案,核心技术方向包括微服务架构、可观测性、AIOps 与 AgentOps。致力于将前沿学术成果与工程实践相结合,推动企业级 AI Agent 系统从 POC 走向可靠的生产落地。
......
议题背景:
89% 的 Agent 项目死于生产环境——不是模型不够强,而是缺少一个持续旋转的闭环来校准它。本 session 提出 Gödel Agentic Flywheel:一套将 AgentOps 方法论工程化为 Observe → Evaluate → Optimize → Govern 持续闭环的实践框架,并赋予其哥德尔递归性——飞轮不仅改进 Agent,还能改进自身的改进逻辑。
理论基础融合 Compound AI Systems(复合系统观)、Antifragility(反脆弱性)、Cybernetic Feedback Loop(控制论闭环)与 Evolutionary Architecture(演进式架构),并引用 2026 年最新学术成果:SARSI 递归自改进框架、MetaSkill-Evolve 双时间尺度元技能演进、AgentOps Automation Pipeline 六阶段自动化模型 等 7 篇前沿论文。
AWS 服务在飞轮中承担关键角色:Amazon Bedrock AgentCore(Runtime / Identity / Policy / Gateway / Memory / Evaluations / Observability / Optimization)构建飞轮引擎;Amazon CloudWatch Omni for Agents 提供 IDE-first 的 Agent+Infra 联动可观测、managed evaluators 与 A/B experiment 能力,实现从本地开发到生产的全链路闭环优化。
本方案已在多个大客户中验证落地,覆盖智能硬件、家电、生命科学、金融等行业的头部企业——从 AgentCore Evaluation & Observability 打法,到多租户 Agent 平台的观测隔离与合规,再到高风险场景的四象限全覆盖方案。从 Level 1 手动飞轮 到 Level 4 全自动 Gödel 飞轮,为你提供可复制的企业级 Agent 自进化路线图。我们将结合 Live Demo 演示 Strands / Claude Agent SDK 等不同 Agent 框架如何落地。

内容大纲:
1. Why 89%: Agent 项目死在生产的真正原因
1.1 非确定性系统的三个失败模式:drift、tool 幻觉、reasoning cascade
1.2 传统 MLOps 为什么救不了 Agent:静态模型 vs. 有状态多步执行体
1.3 三个真实事故复盘(客服 Agent / 医疗 Agent / 交易 Agent)
2. Gödel Agentic Flywheel:理论基础
2.1 复合 AI 系统(Compound AI Systems)作为分析单元
2.2 Antifragility:从"抗故障"到"以故障为食"
2.3 Cybernetic Feedback Loop 与 Evolutionary Architecture
2.4 哥德尔递归性:为什么飞轮要能改进自己的改进逻辑
2.5 引用的 7 篇 2026 前沿论文速览(SARSI / MetaSkill-Evolve / AgentOps Automation Pipeline 等)
3. 飞轮四象限:Observe → Evaluate → Optimize → Govern
3.1 Observe — traces / tokens / tool calls / reasoning chain 的最小采集集
3.2 Evaluate — LLM-as-judge、Golden Set、Human-in-the-loop 的取舍
3.3 Optimize — Prompt / Model / Tool topology / Memory 四类可优化面
3.4 Govern — Identity、Policy、Guardrail、Audit 的分层部署
3.5 四象限之间的信号契约与数据流
4. AWS 飞轮引擎:AgentCore + CloudWatch Omni
4.1 AgentCore 八件套映射到飞轮的四个象限
4.2 CloudWatch Omni for Agents:IDE-first 的开发期可观测
4.3 Managed Evaluators 与 A/B Experiment:从本地跑分到线上灰度
4.4 一份 traces 三处复用:调试、评测、优化
5. 成熟度模型 Level 1 → Level 4
5.1 Level 1 手动飞轮:人评 + 静态基线
5.2 Level 2 半自动:eval 集自动化、告警驱动优化
5.3 Level 3 自动优化:Prompt/Tool 拓扑自动搜索
5.4 Level 4 Gödel 飞轮:飞轮改进自身评测标准与优化策略
5.5 每一级的组织、KPI、投入产出
6. 大客户实证与落地
6.1 智能硬件与家电行业多家头部客户 — AgentCore Evaluation & Observability 打法
6.2 生命科学行业头部客户 — 多租户 Agent 平台的观测隔离与合规
6.3 金融行业头部客户 — 四象限全覆盖:从客服到风控的分层飞轮
6.4 三段客户旅程图与"从 Level N 到 Level N+1"的关键决策
7. Live Demo:不同框架落地飞轮
7.1 Strands Agents 的埋点与评测接入
7.2 Claude Agent SDK 的 Trace 输出与 CloudWatch Omni 联动
7.3 同一 eval 集跑三个框架的对比可视化
7.4 触发一次 Prompt 优化 → 灰度 → 回滚全链路
8. 关键收益与下一步
8.1 Takeaway:可复制的企业级自进化路线图(模板下载)
8.2 常见反模式与陷阱清单
8.3 Q&A

听众收益:
1. 能够画出自己的 Agent 项目当前处在飞轮的哪一个 Level
2. 拿到一份可直接套用的 Observe / Evaluate / Optimize / Govern 信号契约模板
3. 理解 AgentCore + CloudWatch Omni 的具体接入路径
4. 看到 Strands / Claude Agent SDK 在同一飞轮下的实测差异
5. Positioning 与差异化(对内说明)
6. 面向 Agent Builder,问题陈述从"生产死亡率"切入,学术引用 + 框架 demo 是这个场次的差异点
7. 竞品往往只讲 AgentCore 单一产品或某一个框架;本 session 提供的是理论—方法—产品—落地贯穿的完整叙事
8. 与 re:Invent 2026 COP302/303/318/325 相比,本 session 提出的是方法论抽象层,而不是产品 how-to

毛文安
AgentSight 的策略引擎与系统级防护
阿里云智能集团 高级技术专家
长期专注于 GPU 与 eBPF 系统级可观测性、AI Agent 运行时观测、诊断方向。主导 AgentSight 项目——一套基于 eBPF 的系统级 AI Agent 可观测与防护方案:通过在内核层直接观测 Agent 的系统调用、文件与网络行为,为自主 Agent 提供绕过 LLM 语义幻觉的真实行为轨迹采集与实时拦截能力。同时参与 AIProfiling(面向 GPU/智算集群的性能诊断与开源)等系统软件的设计和落地,在 CUDA/PTX 底层、容器与 eBPF 权限模型、内核侧数据采集等方向有较深积累。相信 Agent 时代的可信与安全,最终要落到系统层与内核侧的真实观测与强制执行上,而不能只依赖提示词与框架自律。
议题背景:
AgentSight 是一套基于 eBPF 的系统级 AI Agent 可观测与防护方案。不同于依赖框架埋点或提示词审查的路线,它在内核层直接观测 Agent 进程的系统调用、文件与网络行为,天然绕过 LLM 语义幻觉与框架差异。本次演讲将拆解其策略引擎 如何以"观测—检测—拦截"三级机制,借助 BPF-LSM 在系统调用发生的瞬间完成实时防护:既完整记录 Agent 行为轨迹以支撑事后溯源,又能在危险操作(越权文件写、敏感命令执行、异常外联)落地前将其拦截或阻断。我们将结合真实攻防案例,展示如何以极低开销为自主 Agent 建立一道运行时"最后防线"。

内容大纲:
1. 为什么 Agent 需要系统级防护
1.1 应用层埋点 / 提示词审查的三大盲区:幻觉、可绕过、无源码可依
1.2 从"信任 Agent 会自律"到"在内核假设 Agent 不可信"
2. AgentSight 架构总览
2.1 用 eBPF 在内核观测 Agent 的系统调用 / 文件 / 网络行为
2.2 本地优先(local-first)的数据面与行为轨迹存储
3. 策略引擎:观测—检测—拦截三级机制
3.1 观测层:全量行为边日志与离线溯源建图
3.2 检测层:策略 DSL 与标签 / 污点传播
3.3 拦截层:BPF-LSM 在系统调用瞬间 block / kill
4. 系统级防护实战
4.1 越权文件写与敏感命令执行的实时拦截
4.2 危险外联与数据外泄的边界管控
4.3 开销与误报:生产可用性的工程权衡
5. 总结与展望:把防护做到 Agent 运行时的"最后一公里"

听众受益:
1. 看清应用层 Agent 防护的根本盲区,理解为什么系统级 / 内核级观测是绕不开的一环
2. 掌握"观测—检测—拦截"三级防护的设计思路,可迁移到自研 Agent 平台
3. 了解 eBPF / BPF-LSM 做实时拦截的能力边界与工程开销:哪些能做、哪些做不到
4. 获得一套可落地的 Agent 运行时安全策略参考(文件、命令、网络三类边界)

陈琛
RCA Agent 怎么落地?揭秘 vivo 从服务端到端侧的根因分析智能体实践
vivo 监控与运管平台负责人
vivo 互联网基础平台部监控与运管平台负责人,负责监控可观测、AI 运维与 AI FinOps 三个方向的产品研发。 在 AIOps 领域深耕多年,主导构建 vivo 的 RCA(根因分析)Agent 体系,覆盖应用、日志、域名、主机、容器、自定义指标与端侧 crash 全场景,从服务端延伸至端侧形成完整的根因分析闭环,服务公司互联网业务的日常稳定性保障。 在 AI 时代基础设施方向,主导 AI FinOps 平台建设,实现 AI 工具与模型的全生命周期管理,覆盖成本洞察、预算与配额管控、效能分析,探索大模型时代模型作为新资源品类的计量、分摊与治理路径。 擅长将复杂业务问题转化为可工程化的技术方案,注重从"能用"到"好用"的演进,在 Agent 落地、告警治理与成本运营方向有较多实战沉淀。
议题背景:
在 AIOps 从算法驱动向 Agentic 系统化演进的当下,各类运维智能体应用快速涌现,从告警收敛到故障定位再到自动化修复,Agent正在重塑运维作业方式。但与此同时,业务排障场景的开放性——根因路径无法预先枚举、业务语义难以标准化、噪声与幻觉难以控制——使根因分析(RCA)成为 Agent 落地中最具挑战也最具价值的战场。
作为 vivo 互联网基础平台的监控与运维研发团队,我们构建了覆盖服务端到端侧的 RCA Agent 体系,本次分享将聚焦这一体系的架构设计、工程细节与落地经验。

内容大纲:
1. 为什么 RCA 是 Agent 落地的最佳战场
1.1 AIOps 的演进路径:从算法驱动到 Agentic 系统化
1.2 业务排障的开放性:根因路径为何无法预先枚举
1.3 服务端"三板斧"的结构性盲区
2. RCA Agent 的三层业务资产构建
2.1 语义标准库:统一业务语言,解决 Agent 的业务理解难题
2.2 指标拓扑:构建可推理的因果链路
2.3 变更影响地图:关联变更与故障
3. 对抗噪声与幻觉的工程化手段
3.1 告警置信度评估:从海量告警中筛出可归因的信号
3.2 算子进化:让分析能力随场景持续迭代
3.3 Benchmark 评价体系:如何量化 RCA 效果的好与不好
4. 从服务端到端侧:RCA 的完整闭环
4.1 服务端 RCA 的两类盲区:故障传播中断与用户体验偏差
4.2 主动探测补齐端侧视角:发现盲区、验证恢复
4.3 端侧与服务端协同的闭环设计
4.4 端侧 RCA 能力在外部场景的验证
5. 落地成果与经验沉淀
5.1 从"能用"到"好用"的演进路径
5.2 踩过的坑:数据质量、业务理解、幻觉控制
5.3 下一步:多 Agent 协同与自动化修复

听众收益:
1. 了解 Agent 在根因分析场景落地的业务资产构建方法论,以及从服务端延伸到端侧的 RCA 闭环设计思路。
2. 了解对抗噪声与幻觉的工程化手段(置信度评估、算子进化、Benchmark 评价)及其在具体业务场景中的实践经验。

李光水
SysAgent:AI Profiling 与 AI 基础设施智能诊断实践
阿里云 技术专家
阿里云技术专家,现从事 AI 基础设施可观测方向研发,聚焦大规模 GPU 集群的性能剖析、异常发现、故障诊断与工程化落地。参与 SysAgent 的建设,将 AI Profiling 采集与分析、多源观测数据、领域诊断能力和大模型推理结合,为训练与推理任务提供从异常发现、证据采集到根因分析和处置建议的完整诊断链路。相关能力已应用于万卡GPU 集群,目标是把依赖少数专家的复杂排障经验沉淀为可复用、可持续演进的智能诊断能力。
议题背景:
大规模 AI 训练与推理涉及 GPU、网络、系统及训练框架等多层信号,传统监控往往只能呈现数据,复杂问题仍依赖专家跨系统排查。本次演讲将介绍 SysAgent 在 AI 基础设施可观测与诊断方面的实践:一方面分享 AI Profiling 的采集技术、部署方式与数据分析链路;另一方面结合真实 AI 基础设施系统,讲解如何组织性能剖析、异常感知与融合研判能力,让 Agent 基于真实观测证据完成异常分析、根因判断和处置建议输出,并通过典型故障场景说明其工程价值与能力边界。

内容大纲:
1. AI 基础设施排障面临的新挑战
1.1 跨应用、系统、网络与 GPU 的复杂问题
1.2 告警、指标、日志、调用栈与 Profiling 数据分散
1.3 从展示数据走向结论 + 证据 + 建议
2. AI Profiling 的采集与自动分析
2.1 从任务发起、Trace 采集到瓶颈归因
2.2 AI Profiling、Python 栈与火焰图的组合分析
2.3 将海量原始数据转化为结构化诊断结论
3. SysAgent 的 AI 基础设施观测与诊断实践
3.1 性能剖析、异常感知与融合研判
3.2 领域观测能力与大模型推理结合
3.3 从异常发现到处置建议的诊断闭环
3.4 任务级巡检、告警分级与根因分析
4. 用户实践案例

听众受益:
1. 了解 AI Profiling 在 Kubernetes 与 GPU 集群中的采集对象、部署方式和完整分析链路。
2. 理解如何在真实 AI 基础设施系统中组织性能剖析、异常感知与融合研判能力。
3. 掌握多源观测信号交叉验证、减少误报并形成可执行诊断结论的方法。
4. 通过分布式训练变慢、模型启动缓慢和大规模建连失败等案例,获得可复用的排障思路。
5. 了解大模型进入基础设施诊断链路后的适用边界、工程代价与评测方法。

敬请期待
敬请期待
......
......
......
SECon组委会是由业界多位资深技术专家发起,负责组织技术指导委员会,并和委员会的专家一起挖掘全球软件工程领域的创新技术,同时依托智盟创课国内领先的人才能力提升服务供应商,组织专业的会务服务团队,全面推进会议的顺利落地,保证参会者体验。
服务总线:400-183-9980
商务合作:151-2264-3988  木子  
票务联系:185-1306-7287  静秋老师
E-mail:speaker@qecon.com.cn
关注SECon公众号
添加SECon小助手,获取
会议最新资讯
电话
联系电话:
18513067287 静秋老师