<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Durability on CAO ZUOHUA</title><link>https://caozuohua.github.io/tags/durability/</link><description>Recent content in Durability on CAO ZUOHUA</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Wed, 01 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://caozuohua.github.io/tags/durability/index.xml" rel="self" type="application/rss+xml"/><item><title>智能体问题：可靠性与中途崩溃</title><link>https://caozuohua.github.io/posts/2026-07-01-agent-reliability-crash/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://caozuohua.github.io/posts/2026-07-01-agent-reliability-crash/</guid><description>&lt;h2 id="智能体的半途而废之痛"&gt;智能体的&amp;quot;半途而废&amp;quot;之痛&lt;/h2&gt;
&lt;p&gt;写代码的人都知道——程序崩溃不可怕，可怕的是崩溃后状态全丢，只能从头再来。&lt;/p&gt;
&lt;p&gt;智能体面临的就是这个问题。一个 20 步的自动化任务，执行到第 15 步时 LLM API 超时了，所有中间状态消失。下次运行从第 1 步重新开始，前面的 14 步白做了。如果有副作用（已经发了一封邮件、已经创建了一条数据库记录），那就更麻烦——重做会导致重复操作。&lt;/p&gt;
&lt;p&gt;Temporal 的技术博客 2026 年 4 月发表了一篇引起广泛共鸣的文章，核心观点是：&lt;strong&gt;AI 可靠性是一个十年前就该解决、现在仍然只解决了一半的问题。我们应该用基础设施手段而非更好模型来解决它&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id="为什么智能体会中途崩溃"&gt;为什么智能体会中途崩溃？&lt;/h2&gt;
&lt;h3 id="原因一llm-推理本身就是不稳定的"&gt;原因一：LLM 推理本身就是不稳定的&lt;/h3&gt;
&lt;p&gt;传统软件的执行路径是确定性的——给定相同输入，永远走同一条路。LLM 不是。每一次推理都是一次概率采样，天生带有不确定性：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;API 超时&lt;/strong&gt;：模型推理慢时，HTTP 请求可能超时中断&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Token 限制&lt;/strong&gt;：上下文窗口满了，前面的轮次被截断&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Rate Limit&lt;/strong&gt;：API 调用频率受限，被 429 返回&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;服务降级&lt;/strong&gt;：高峰期模型响应质量下降&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;随机中断&lt;/strong&gt;：GPU 集群节点切换、负载均衡导致连接中断&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些问题不是偶尔发生的，在大规模生产环境中是&lt;strong&gt;常态&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id="原因二智能体状态是内存态的"&gt;原因二：智能体状态是&amp;quot;内存态&amp;quot;的&lt;/h3&gt;
&lt;p&gt;大多数 Agent 框架把执行状态存在内存中：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#75715e"&gt;# 典型的 Agent 循环&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;state &lt;span style="color:#f92672"&gt;=&lt;/span&gt; initial_state
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#66d9ef"&gt;for&lt;/span&gt; step &lt;span style="color:#f92672"&gt;in&lt;/span&gt; plan:
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; state &lt;span style="color:#f92672"&gt;=&lt;/span&gt; llm_call(step, state) &lt;span style="color:#75715e"&gt;# state 在内存&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; state &lt;span style="color:#f92672"&gt;=&lt;/span&gt; tool_call(step, state) &lt;span style="color:#75715e"&gt;# 一旦进程挂了，state 全丢&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;传统软件有数据库保驾护航——应用挂了重启后数据还在。Agent 框架呢？进程一死，所有中间推理、工具返回、上下文积累全部消失。&lt;/p&gt;
&lt;h3 id="原因三长链路任务的脆弱性"&gt;原因三：长链路任务的脆弱性&lt;/h3&gt;
&lt;p&gt;智能体任务越复杂，包含的步骤越多，执行成功率呈指数下降：&lt;/p&gt;
&lt;pre tabindex="0"&gt;&lt;code&gt;单步成功率 95%
10 步任务成功率: 0.95^10 = 59.9%
20 步任务成功率: 0.95^20 = 35.8%
50 步任务成功率: 0.95^50 = 7.7%
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;即使每步有 95% 的成功率（这已经是优秀的表现），一个 20 步任务就有近 2/3 的概率在某步失败。而大多数真实业务场景不止 20 步。&lt;/p&gt;</description></item></channel></rss>