有一个问题我被问过很多次,几乎每次分享都有人提:
“我们企业内部有些场景对精准度要求很高。正因为精度要求高,是不是应该用工作流编排,而不是让大模型自主规划?”
每次听到这个问题,我的回答都是同一句:
这个想法大错特错。因为你的前提就是反的。
你假设了“工作流更准确、更可靠”。事实恰恰相反。
**一定要记住:Agent Harness 是更可靠的、更稳定的、准确率更高的。**在 90% 的情况下,只要你把 Agent Harness 用对了,稍微下点功夫,它对工作流都是碾压。
这一篇我把这件事讲透。这可能是今天企业 AI 落地里,最贵的一个认知误区。
为什么这么多人相信工作流更可靠
因为传统程序员的思维太重了。
传统软件工程的信念是:把流程拆解清楚,一步一步定义好,系统才可控。人类先把思考过程想明白,再把它固化成代码。
在人类手写软件的年代,这是对的。
但到了这一代 AI 面前,这个信念反过来了:人类事先想好的那套流程,往往才是错的。
因为真实世界不按你画的流程图运转。
真实世界的流程有多复杂
工作流真正适用的场景,其实非常窄——“我要给一篇文章做个摘要,然后发到小红书”,这种确实永远是流程。
但真实世界里白领办公的绝大多数场景,用工作流都是扯淡。
我给机械厂做的那个 CAD 拆解,你去想想它的真实过程是什么样:
一张大图进来,AI 要先看一眼整体,判断这是个什么东西;然后它发现某个位置的标注看不清,于是决定把局部放大再看一次;确认了标注上的数字之后,再决定要不要切图;切完之后判断这个零件需要哪些工艺,还得回头去核对另一个位置的信息。
**这些判断都是它自己现场做的。**放大还是缩小、看局部还是看全局、该不该切图、下一步调用哪个工具——没有一条是我事先规定好的。
你用工作流怎么写这个?你写二十个节点、两百个节点,都覆盖不了真实图纸的千变万化。
低代码工作流那个东西非常脆弱,很容易死掉。你稍微遇到一点新东西,完蛋了,根本就跑不动。
这也是为什么,当初那家 RPA 厂商给环保客户的报价条件是:“你要能保证报表格式永远不变、政府网站永远不更新,我可以做到 60% 的准确率。”
**这不是他们不努力。这是他们那条技术路线的天花板。**格式固定、页面固定,是工作流能活下去的前提。而真实业务里,这个前提永远不成立。
Agent Harness 到底是什么
说清楚我在用的东西。
底层是一个行动力极强的 coding agent——你可以理解成 Claude Code 那一类东西的内核。
然后你给它配三样东西:
- 执行手段:bash 命令、可以写和运行的代码;
- 工具:MCP 工具。比如我给 CAD 那个项目配了一个工具,能把 CAD 格式转成 PNG——这样大模型就可以先用视觉看懂这张图在讲什么,再用代码去编辑它;
- 经验:skill。也就是从这个企业里萃取出来的业务流程和判断逻辑。
配好之后,剩下的让它自己决定。
它自己判断这一步该干什么、要不要再看一眼、该调哪个工具。整个过程是全自动的,不需要手写工作流,也不需要我预先编排。
顺便说一句,我见过不少团队号称在做 Agent,实际是“一个主 agent 挂几个写死的子 agent,外面再套一层编排”。
**那本质上还是工作流,只是换了个说法。**那些子 agent 既然是你写死的,为什么不干脆做成 MCP 工具?做成工具,主 agent 反而能更灵活地决定什么时候用它。
回应三个最常见的反驳
“Agent 不稳定。”
那是因为你没有把它挖掘到位。
不稳定就多跑几遍,改一改 prompt、改一改 skill,把边界写清楚,让它稳定下来。这本来就是要下功夫的地方。
实在稳定不了,回头看看是不是模型选得太差了——很多时候不是架构问题,是你用的模型 agentic 能力还不够,换一个更好的就解决了。
“Agent 不可解释。”
skill 本身就是可解释的——它就是一段人能读懂的文字,写清楚了在什么情况下该怎么做。case 也是可查的,每一次执行的轨迹都摆在那里。
真正不可解释的,恰恰是那个写了两百个节点、没人能完整讲清楚为什么这么连的工作流。
“我们精度要求高,不敢让它自由发挥。”
精度问题不是靠捆住它的手脚来解决的,是靠校验和审核来解决的。
我在环保那个项目上的做法是:让 AI 填完每一个格子之后,为这个格子单独写一段代码,回头去原始 PDF 里把这个数字的来源再撞一次,确认它真的出现在那一页。机器先自检,人再审核。
这才是提高精度的正确姿势——不是限制它的能力,而是给它的产出加验证。
整件事的手艺,恰恰在于同时做到两点:**既要让它保持自由发挥的空间,又不许它乱来。**这个尺度是这门活最难的地方,但绝不是靠退回工作流来解决的。
24、25 年的企业 AI 为什么那么糟
我认为工作流这条路,要为过去两年企业 AI 落地的糟糕结果负很大一部分责任。
**工作流一点都不是 AI 时代的思想。**编排二十个节点、两百个节点,做出来的 demo 只能适应某种很 tricky 的、非常简单的场景。一上客户的真实数据,立刻现原形。
然后就走到那个所有人都熟悉的结局:
做不出来 → 上不了线 → 勉强上线以后被用户骂 → 系统落灰。
那两年不是 AI 不行,是很多人用上一代的架构思想,去做这一代的事情。
最后
如果你正在评估一个 AI 供应商,我给你一个很实用的检验方法:
问他,你们的 Agent 架构是怎么做的?
如果答案是“我们做了一套工作流编排”、“我们有一个可视化的流程画布”、“我们做了多 agent 的编排”——你要非常小心。这大概率是上一代的东西套了个新名字。
如果答案是围绕 Agent Harness 展开的——底层用什么 agent、配了哪些工具、skill 怎么萃取、怎么做自检和人工审核、怎么用评测驱动它进化——那你大概率遇到了跟得上这一代的人。
效果好才是最重要的。效果不好,一切都是扯淡。