跳到正文

洞察 案例拆解

三个专业团队干了一年,最好 60 分。我用三天做到 98 分

三个专业团队接力一年最好 60 分的活,我们三天做到 98 分——把技术上到底做对了什么,完整拆开。

上一篇我说,企业 AI 落地真正的生死线是准确率。这一篇我把最狠的那个案例完整拆开——包括技术上到底做对了什么。

先说结果:**三个专业团队接力干了一年,最好成绩 60 分。我用三天,做到 98 分。**用客户自己拿来的、我从没见过的新数据,在他们办公室里现场测的。


这道题到底难在哪

客户是广东一家环保检测公司。

它的业务是这样的:东莞一带的各类工厂——面粉厂、文具厂,什么厂都有——排放废气废水,国家要求它们必须在全国排污许可证信息管理平台上填报数据。检测公司负责去厂里装设备、取数、出报告。厂子拿着报告,自己上政府平台填表。

这个表有多难填?

**一个格子里的一个数字,背后是几十份 PDF 检测报告里的十来个数值。**而且不是简单相加——要算浓度、算流量、算瞬时速率、算平均值,一整套运算。

一个熟手填一个公司的表,从早干到晚,要一整天。

而且填错要担责任。政府会抽查,你填的数和检测报告上的数对不上,是要被查的。

所以这件事的门槛不只是“提取数字”。它是:在几百页非结构化的 PDF 里,找到正确的那十个数值,用正确的公式算出来,填进正确的格子,并且要让人敢签字。

顺便说一句,PDF 里的表格是所有文档类型里最难处理的。几百个文件、每份二三十页、几百个数字,全在里面。

三份失败的答卷

**第一家是某知名 RPA 厂商。**收了客户将近十万块的 POC 费用,做完之后跟客户说:你要能保证每一份报表的字段永远固定、政府网站永远不更新,我可以做到 60% 的准确率。

客户当场就懵了——我怎么可能保证表格永远不变?政府那个网站全国的供应商都在用,怎么可能不更新?

POC 的钱打了水漂。

**第二家是一家专业做 AI 软件的团队。**做了一段时间,没做出来,效果很差。

**第三家是某高校一位博导带的博士团队。**客户给了钱,觉得博士总该行了吧。干了四五个月,准确率还是 60% 左右。

三家,一年,最好 60 分。

这里要多说一句:60 分不是“差一点”,60 分是“完全不能用”。

因为 60 分意味着人还得全部复核一遍。他们此前的经历就是这样——为了给供应商评估准确率,客户自己要花大半天时间去挑错、打分。人工核对的成本,已经快赶上自己从头填了。

60 分的 AI 是玩具,95 分以上才是生产力。差的那一点点,就是“每天在用”和“吃灰落灰”的区别。

我做对了什么

客户团队里有人听过我的分享,找到我。我看了一眼这个题目,判断能做,就说:我不收 POC 的钱,我先给你做。

前后花了三四天。这三四天里,我把整个算法架构推翻重来了十几版——每一版的浏览器插件都不一样,每一版对 AI 的约束尺度都不一样。

下面是真正起作用的四件事。

一、不用工作流,用 Agent Harness

上一代做这类任务的标准解法是低代码工作流编排:把流程拆成节点,一个一个接起来。

**这个东西非常脆弱。**你写二十个节点、两百个节点都没用,稍微遇到一点新情况就跑不动。RPA 厂商为什么要求“格式永远不变、网站永远不更新”?因为他们的技术路线只能承受这个前提。

我用的是 Agent Harness:底层是一个行动力极强的 coding agent,给它配 bash、配代码、配 MCP 工具、配 skill,让它自己判断该怎么做——该看全局还是局部,该不该放大,该调用哪个工具。

它自己会想办法,所以格式变了、网站改版了,它不会立刻瘫痪。

二、让 AI 自己先校验一遍

这一步是准确率能上 90 分的关键。

AI 每填完一个格子,会为这个格子单独写一段代码,回头去原始 PDF 里把这个数字的来源再撞一次——确认它真的出现在那一页。

而且这个撞法要能应付各种写法。同一个数值,文档里可能写成 4.69,也可能写成 44×10⁻²。这些情况它都得能验出来。

**机器先自检一遍,人再审核。**这个过程的精密程度,完全不亚于写代码——本质上就是给每一个结果做单元测试。

三、把审核直接做进结果页

这是我认为整套方案里最巧的一步,而且它解决的是一个信任问题,不是技术问题。

客户此前给供应商提的需求是:另外复刻一个网页,在复刻的页面里审核,审完再用浏览器自动填回政府网站。

问题来了:你怎么证明中间那一步审核过的数字,和最后填进去的是同一个?

多引入一个环节,就多一层不可信。而这是要向政府提交、要担责任的东西。

我受沉浸式翻译的启发——它能直接往网页里注入内容——干脆把审核做进政府网站那个真实页面本身:

  • 在页面右上角注入一个“审核”按钮
  • 点开是一个侧边栏
  • 每一个数字点一下,直接跳回它来自哪份 PDF 的哪一页
  • 觉得不对,可以当场在原文里搜关键词比对

人原来是怎么干的?搜“挥发性有机物”这个词,在十个文档里逐个找,把数值抄到 Excel 里,套公式算,再填回去。我把这一整套动作,压缩进了一个侧边栏。

审核和填报在同一个页面完成,那个信任死结就不存在了。

顺便说一个很多人没意识到的事实:**Codex、WorkBuddy 这类通用产品,标准界面里是没有审核能力的。**它给你干完一件事,你怎么知道对错?

这就是通用工具在核心业务上永远赢不了的地方。只要 AI 能做到九十多分,剩下那百分之十,我有办法让人补上——这样就一定能赢。

四、让它越用越聪明

第一版准确率如果没到 95%,我照样先交给客户用。

但我会要求他们:审核时凡是发现错的,直接在界面上写清楚——错在哪、应该填什么。这些反馈结构化地存进后台。

攒够足够多的 case 之后,我再让一个 agent 去抽象这些错误,回头改 skill 里的经验描述,或者改掉某一段校验代码。

这里有个必须守住的分寸:**不能来一个错误就改一次代码。**那样改,模型的灵活性和通用性就被你改没了。整件事一直在两个方向上找平衡——既要让它保持自由发挥的空间,又不许它乱来。

这就是评测驱动的自进化。我交付的不是一次性软件,是一个越用越聪明的 agent。

反过来说也成立:你必须给客户一个闭环。否则交付一个 80% 的东西扔在那儿,让客户自己去应对剩下的 20%——客户是不会接受的。

现场那一天

我带着 demo 去东莞,在他们办公室里,他们拿自己的真实数据往里面怼。

他们特意换了几家我没见过的公司的表来试。几百个数值,只错了一两个。

他们比我还兴奋,一直说:再换一个,再换一个公司试试行不行。

他们说了一句让我印象很深的话:以前跟那些软件公司合作,每天帮他们做测试、给他们挑错、打分,一个准确率我要评估大半天;在你这里我花十分钟审核就完了。

原来一个人从早填到晚的活,现在 AI 跑十几分钟,人审核二三十分钟。

然后发生了一件我没料到的事

客户老板的关注点,当场就不在这个表上了。

他开始跟我聊全国扩张。

这个行业以前地域性极强——样品要寄回实验室,有保质期,所以做检测的公司很难跨省。但如果他能做到“同行出一份报告要一个月,我一个星期甚至一天”,那这就不是效率问题了,这是他走出广东、走向全国的武器

他还讲到了以此为节点去筹划上市。

然后他说了一句话,我一直记着:

“以前我对信息化、智能化也有愿景,我也想这么干。但供应商一直做不出来,那些愿景都落不了地。”

这句话说透了一件事:过去几年老板的愿景落不了地,不是他想错了,是供应商的水平兜不住他的想象力。效果不行,视野就不敢打开。

所以我现在跟老板的分工特别简单:

你负责商业,我负责 AI。你想自动化哪个环节,我就把哪个环节的准确率做到极致。

当落地不再有后顾之忧,老板的商业想象力才真正开始值钱。

最后

这个案例讲完,我最想说的其实不是“我多厉害”。

我想说的是:我做出来的这个准确率,本来就是今天的 AI 应该能达到的水平。我只是把今天该有的水平,用一个更好的解决方案和产品形态发挥了出来。

今天 AI 已经把程序员的工作替代了 99%。做应用开发本身就是件高难度的事。那么——你们行业请的环保专家、医疗专家、物流专家,工资比程序员更高吗?

AI 都能把程序员的活干到 99%,凭什么你的行业核心业务做不到?

如果你手里也有一个“所有供应商都说做不了”的活,或者一个已经做砸了的 AI 项目——欢迎拿来考我们。我最好的几个客户,都是这么开始的。