摘要本文针对 AI Agent 上线后“服务活着却在胡说”的监控盲区梳理了只看存活、只看成本、不盯幻觉三种常见错误提出 Agent 监控应在传统指标之外额外关注成功率、Tool Error、Latency、Cost、Token、Memory Hit、Hallucination 七个 LLM 专属维度并给出七指标看板、Mermaid 架构图、Prometheus 打点与离线 eval 示例最后按“可用性必告警、质量类观察为主”的分级原则避免告警疲劳。系列AI Agent 工程实践上一篇第 32 篇《Agent 如何上线》下一篇第 34 篇《企业 AI Agent 架构》一、开场agent 变傻了没人知道运营说最近 agent 答得不对。工程师去查发现三天前某个模型版本更新后特定问题开始胡说。但因为没有监控谁也说不清是哪天开始的哪个场景哪个模型影响多少用户只能靠用户投诉反推。上篇32讲安全上线这篇讲上线后怎么知道它好不好——监控。二、问题背景传统监控不够只看服务存活# 健康检查只返回 200 app.get(/health) def health(): return {status: ok} # 服务活着 ≠ agent 答得好Agent 挂了HTTP 500你会知道但它活着却在胡说传统监控毫无感知。Agent 监控 传统指标 LLM 专属指标。三、错误尝试三种监控盲区错误 1只看 CPU/内存/存活服务没崩就以为没事质量劣化完全盲区。等到发现已经是大量错误回答被用户看见了。错误 2只看成本成本没超就安心但成本和质量是两个轴——可能又贵又烂省钱但答非所问。错误 3不盯幻觉LLM 偶尔胡说正常不量化幻觉率等到客诉才暴露信誉损失已发生。四、关键观察Agent 要盯七个指标传统服务的指标QPS、错误率、延迟只是底座。Agent 额外要盯7 个 LLM 维度成功率请求完整跑完、未异常中断的比例。Tool Error工具调用失败率——Agent 最常见的硬错误。Latency端到端延迟P50/P95——用户体感。Cost单请求成本 日/月总成本趋势。Token输入/输出 token 消耗成本与上下文膨胀的前兆。Memory Hit记忆命中率——命中低说明记不住用户体验差。Hallucination幻觉率——靠 eval 集 用户反馈打分量化。前 5 个可直接打点后 2 个要靠埋点 评估 反馈间接度量。缺任何一个你对系统的认知就有盲区。五、最终方案七指标看板指标定义为什么必须看异常信号成功率未异常中断的请求占比系统基本可用性突降Tool Error工具调用失败次数/总调用Agent 主要硬错误源持续 2%LatencyP50/P95 端到端耗时用户体感P95 翻倍Cost单请求 周期总成本烧钱速度日均超预算Token输入输出 token 量上下文膨胀/成本前兆陡增Memory Hit命中长期记忆比例是否记住用户持续偏低Hallucination幻觉回答占比质量底线上升监控数据流向Agent 运行时打点 → 日志/链路收集 → 指标聚合 → 看板 告警。六、架构图Mermaid七、代码与配置示例用计数器打点伪 Prometheusfrom prometheus_client import Counter, Histogram REQ Counter(agent_requests_total, 总请求) TOOL_ERR Counter(agent_tool_errors_total, 工具失败) LAT Histogram(agent_latency_seconds, 端到端延迟) LAT.time() def handle(req): REQ.inc() try: return run_agent(req) except ToolError: TOOL_ERR.inc() # 工具失败单独计数 raise幻觉率靠离线 eval# 每日跑 eval 集统计答非所问比例 bad sum(1 for c in eval_set if not is_correct(c)) hallucination_rate bad / len(eval_set) # 趋势监控八、设计权衡告警 vs 观察指标建议理由成功率/Tool Error必告警直接影响可用Latency P95告警体感硬指标Cost/Token观察预算线趋势性不必秒级Memory Hit观察体验指标Hallucination周级观察需 eval滞后反过度告警什么都告警 告警疲劳真正异常被淹没。分级——可用性必告警质量类观察为主。把告警留给不处理就出事的指标。九、总结✅ 服务活着 ≠ agent 答得好传统监控对质量劣化盲区。✅ 三种盲区只看存活、只看成本、不盯幻觉。✅ Agent 监控 传统指标 7 个 LLM 维度成功率/Tool Error/Latency/Cost/Token/Memory Hit/Hallucination。✅ 前 5 直接打点后 2 靠 eval 用户反馈间接度量。✅ 分级可用性必告警质量类观察为主防告警疲劳。下一篇把前面所有零件画成一张企业全链路图。34参考资料带用途说明本系列32Agent 如何上线本文监控指标是32灰度/全量判断的依据。本系列27日志系统监控的打点数据来自27的日志字段设计。本系列28可观测性Trace/Span 是本文链路追踪的理论基础。本系列30Agent 如何做测试幻觉率评估复用30的 Golden Dataset。Prometheus 文档prometheus.io指标打点与聚合的实现参考。本文是 AI Agent 工程实践系列的第 33 篇第四阶段第十三篇。系列导航上一篇第 32 篇《Agent 如何上线》下一篇第 34 篇《企业 AI Agent 架构》