凌晨三点,你的 AI Agent 没有崩溃、没有报错,它只是安静地不再回应。当 LLM 应用从 demo 走向长期在线服务,失败模式会从"代码有 bug"变成"系统在你看不见的地方慢慢变质":长连接被静默杀死、内存被遗留文件吃光、Agent 改坏自己的配置。本议题基于开源 AI Agent(AnkaLoop)的真实故障档案,给出五种生产环境遭遇的事故图鉴,以及从数据库习得的 3 种解法,WAL 的 intent-before-effect、fail-closed 恢复、checkpoint 与 journal 的取舍等内容。帮大家更好的理解 Agent 以及为 Agent 可靠性增加一些思路。