跳到正文

洞察 技术判断

别再用工作流做 Agent 了——那是上一代的思想

「精度要求高就该用工作流」——这个前提就是反的。精度靠校验和审核,不是靠捆住 AI 的手脚。

有一个问题我被问过很多次,几乎每次分享都有人提:

“我们企业内部有些场景对精准度要求很高。正因为精度要求高,是不是应该用工作流编排,而不是让大模型自主规划?

每次听到这个问题,我的回答都是同一句:

这个想法大错特错。因为你的前提就是反的。

你假设了“工作流更准确、更可靠”。事实恰恰相反。

**一定要记住:Agent Harness 是更可靠的、更稳定的、准确率更高的。**在 90% 的情况下,只要你把 Agent Harness 用对了,稍微下点功夫,它对工作流都是碾压。

这一篇我把这件事讲透。这可能是今天企业 AI 落地里,最贵的一个认知误区。


为什么这么多人相信工作流更可靠

因为传统程序员的思维太重了。

传统软件工程的信念是:把流程拆解清楚,一步一步定义好,系统才可控。人类先把思考过程想明白,再把它固化成代码。

在人类手写软件的年代,这是对的。

但到了这一代 AI 面前,这个信念反过来了:人类事先想好的那套流程,往往才是错的。

因为真实世界不按你画的流程图运转。

真实世界的流程有多复杂

工作流真正适用的场景,其实非常窄——“我要给一篇文章做个摘要,然后发到小红书”,这种确实永远是流程。

真实世界里白领办公的绝大多数场景,用工作流都是扯淡。

我给机械厂做的那个 CAD 拆解,你去想想它的真实过程是什么样:

一张大图进来,AI 要先看一眼整体,判断这是个什么东西;然后它发现某个位置的标注看不清,于是决定把局部放大再看一次;确认了标注上的数字之后,再决定要不要切图;切完之后判断这个零件需要哪些工艺,还得回头去核对另一个位置的信息。

**这些判断都是它自己现场做的。**放大还是缩小、看局部还是看全局、该不该切图、下一步调用哪个工具——没有一条是我事先规定好的。

你用工作流怎么写这个?你写二十个节点、两百个节点,都覆盖不了真实图纸的千变万化。

低代码工作流那个东西非常脆弱,很容易死掉。你稍微遇到一点新东西,完蛋了,根本就跑不动。

这也是为什么,当初那家 RPA 厂商给环保客户的报价条件是:“你要能保证报表格式永远不变、政府网站永远不更新,我可以做到 60% 的准确率。”

**这不是他们不努力。这是他们那条技术路线的天花板。**格式固定、页面固定,是工作流能活下去的前提。而真实业务里,这个前提永远不成立。

Agent Harness 到底是什么

说清楚我在用的东西。

底层是一个行动力极强的 coding agent——你可以理解成 Claude Code 那一类东西的内核。

然后你给它配三样东西:

  • 执行手段:bash 命令、可以写和运行的代码;
  • 工具:MCP 工具。比如我给 CAD 那个项目配了一个工具,能把 CAD 格式转成 PNG——这样大模型就可以先用视觉看懂这张图在讲什么,再用代码去编辑它;
  • 经验:skill。也就是从这个企业里萃取出来的业务流程和判断逻辑。

配好之后,剩下的让它自己决定。

它自己判断这一步该干什么、要不要再看一眼、该调哪个工具。整个过程是全自动的,不需要手写工作流,也不需要我预先编排。

顺便说一句,我见过不少团队号称在做 Agent,实际是“一个主 agent 挂几个写死的子 agent,外面再套一层编排”。

**那本质上还是工作流,只是换了个说法。**那些子 agent 既然是你写死的,为什么不干脆做成 MCP 工具?做成工具,主 agent 反而能更灵活地决定什么时候用它。

回应三个最常见的反驳

“Agent 不稳定。”

那是因为你没有把它挖掘到位。

不稳定就多跑几遍,改一改 prompt、改一改 skill,把边界写清楚,让它稳定下来。这本来就是要下功夫的地方。

实在稳定不了,回头看看是不是模型选得太差了——很多时候不是架构问题,是你用的模型 agentic 能力还不够,换一个更好的就解决了。

“Agent 不可解释。”

skill 本身就是可解释的——它就是一段人能读懂的文字,写清楚了在什么情况下该怎么做。case 也是可查的,每一次执行的轨迹都摆在那里。

真正不可解释的,恰恰是那个写了两百个节点、没人能完整讲清楚为什么这么连的工作流。

“我们精度要求高,不敢让它自由发挥。”

精度问题不是靠捆住它的手脚来解决的,是靠校验和审核来解决的。

我在环保那个项目上的做法是:让 AI 填完每一个格子之后,为这个格子单独写一段代码,回头去原始 PDF 里把这个数字的来源再撞一次,确认它真的出现在那一页。机器先自检,人再审核。

这才是提高精度的正确姿势——不是限制它的能力,而是给它的产出加验证。

整件事的手艺,恰恰在于同时做到两点:**既要让它保持自由发挥的空间,又不许它乱来。**这个尺度是这门活最难的地方,但绝不是靠退回工作流来解决的。

24、25 年的企业 AI 为什么那么糟

我认为工作流这条路,要为过去两年企业 AI 落地的糟糕结果负很大一部分责任。

**工作流一点都不是 AI 时代的思想。**编排二十个节点、两百个节点,做出来的 demo 只能适应某种很 tricky 的、非常简单的场景。一上客户的真实数据,立刻现原形。

然后就走到那个所有人都熟悉的结局:

做不出来 → 上不了线 → 勉强上线以后被用户骂 → 系统落灰。

那两年不是 AI 不行,是很多人用上一代的架构思想,去做这一代的事情。

最后

如果你正在评估一个 AI 供应商,我给你一个很实用的检验方法:

问他,你们的 Agent 架构是怎么做的?

如果答案是“我们做了一套工作流编排”、“我们有一个可视化的流程画布”、“我们做了多 agent 的编排”——你要非常小心。这大概率是上一代的东西套了个新名字。

如果答案是围绕 Agent Harness 展开的——底层用什么 agent、配了哪些工具、skill 怎么萃取、怎么做自检和人工审核、怎么用评测驱动它进化——那你大概率遇到了跟得上这一代的人。

效果好才是最重要的。效果不好,一切都是扯淡。