别再追 V4 和 5.6 了
「2026跨境电商领航者峰会」9月9日·深圳,跟着谷歌官方吃透 AI 营销与旺季打法>>>
别再追 V4 和 5.6 了
——我付费用了两年 ChatGPT 和 Gemini,才想明白 AI 到底该怎么用
这一轮 AI 工具的大爆发,真正让人焦虑的不是工具太多,而是我们一直在用一把错误的尺子量进步——量版本号,而不是量交付。
先交代身份。我在供应链行业干了二十多年,从中兴通讯出来,做过物流与供应链管理协会副秘书长,跟几千家供应链企业打过交道,看着年富、润泰、腾邦这些百亿级供应链公司一个一个爆雷。我做深圳市跨境电子商务协会和跨境电商供应链服务协会,每天的工作就是研究"中国制造怎么更好地卖到全球"。
我是 2024 年开始付费使用 ChatGPT 和 Gemini 的。那时候国内还在争论"这东西能不能用",我已经在拿它做跨境电商的政策梳理、供应链资料整理、给会员企业写方案。两年下来,工具换了不知道多少茬,我反倒越来越确定一件事:
追版本号,是这一轮最低效的勤奋。
📌 核心要点速读
1. 模型不变、只改执行框架,成绩能翻近三倍——这是 OpenAI 自己给的数字,不是我的判断。
2. 真实提效 = 生成速度 × 一次通过率。格式不对的"快",是假快。
3. 用 AI 而不沉淀,等于每天在重复交学费。
4. 国内 AI 办公桌面端月活约 3000 万,相比传统办公软件还有约 20 倍空间——绝大多数人还没真正用起来。
📋 目录
一、半年换三代:我看着这些工具在流沙上盖楼
二、最锋利的一刀:模型不变,只改框架,成绩翻了近三倍
三、假快与真快:提效的分水岭是"一次通过率"
四、每一次使用,都应该留下一份资产
五、别追工具的版本号,追你企业的版本号
六、个体提效之后,是组织进化——给出海企业的一句提醒
◆ ◆ ◆
一、半年换三代:我看着这些工具在流沙上盖楼
我把最近这半年发生的事捋了一遍,自己都吓了一跳。
2025 年 3 月,Manus 横空出世,被叫作全球首款通用 AI 智能体。八个月 ARR 破一亿美元,月活峰值逼近两千万,内测邀请码在二手平台被炒到近十万。那是它最高光的时刻。年底 Meta 宣布以超过 20 亿美元收购,扎克伯格亲自操盘,十几天敲定。然后——2026 年 4 月 27 日,国家发改委依法作出禁止投资决定,要求撤销这桩收购。这是中国首次依据外商投资安全审查机制,正式叫停一起大型 AI 领域的跨境并购。此后 Manus 月活一路滑落,再后来,腾讯牵头中方资本从 Meta 手里全盘回购了它的股权,启动港股上市筹备。
2026 年 1 月,一只"龙虾"火了。它真名 OpenClaw,是奥地利程序员 Peter Steinberger 做的开源智能体,因为吉祥物是龙虾,国内都叫它龙虾。名字改了三轮:Clawd / ClawdBot → MoltBot → OpenClaw,1 月 30 日才定下来。GitHub 星标从一百涨到三十三万,创下史上增长最快的开源项目纪录。它能读你的文件、开你的浏览器、跑你的代码。彼得给它开了几乎全部权限:邮件、日历、所有文件,甚至家里的灯光和音响。
代价是 token 烧得吓人。彼得自己估算,按真实消耗每月应该超过一万美元,而他实际只付了一千美元——因为他用的是面向个人消费者的包月订阅。Anthropic 先是封号,再发律师函要求更名,理由是 Clawbot 与 Claude 读音太近。社区炸了,喊出"the claw is law"。最后 OpenAI 把彼得招进了自己的智能体研发团队。
后面还有一出更荒诞的:有人给这些龙虾办了个只允许 AI 进入的社交网络 Moltbook,一周涌进十五万个智能体,它们甚至"发明"了自己的秘密语言。特斯拉的马斯克说这是"奇点的极早期阶段";OpenAI 联合创始人 Karpathy 转发说"我见过最接近科幻起飞的东西"。几天后,安全公司 Wiz 用三分钟拿到了平台的全部数据库权限,一百六十万账户、一百五十万个 API token 全部裸奔。Karpathy 改口:"这东西是个垃圾场,我绝对不建议任何人在自己电脑上跑这些。"
2026 年 6 月 9 日,字节把 TRAE SOLO 正式更名 TRAE Work,品牌内涵从"真正的 AI 工程师"改成"真正的 AI 赋能者"。8 月,TRAE 和扣子团队整体并入豆包体系,豆包还要推出独立的 AI 办公产品"豆包工作"。
8 月 13 日,DeepSeek 开源了 Agent 运行框架 Harness,简称 DSH,设计思路是"一切皆插件"。8 月 27 日,百度搭子在上海开"搭子进行时"发布会,喊出"交付即惊艳",月活 674.30 万,环比增长 1063.79%。
半年,主流工具换了三代。有的改名,有的被收购,有的被叫停,有的直接合并进别的品牌。
我现在主力用 WorkBuddy,腾讯云的全场景 AI 办公工作台。易观的数据显示,2026 年 6 月它以 2097 万月访问量、831% 的环比增速,在桌面端 AI 原生办公智能体赛道领跑。有意思的是,前面说的 Manus,也是腾讯牵头买回来的——一个深耕国内政企、严守本土合规,一个以新加坡主体主攻海外全球。
连腾讯这样的公司,都不敢只押一个工具。
所以我的第一个判断很直接:工具的半衰期,已经比人学会一个工具的时间还短了。你在流沙上盖房子,盖得越快,塌得越快。
◆ ◆ ◆
二、最锋利的一刀:模型不变,只改框架,成绩翻了近三倍
这一章是整篇文章我最想说的话,也是让我彻底放弃"追版本"的那个数字。
OpenAI 在 Codex 的开源材料里给过一组数据,我看了三遍:仅靠 Harness 层面的改进——保留推理、做上下文压缩——在模型完全不变的前提下,ARC-AGI-3 的得分从 13.3% 提升到 38.3%,而输出 token 下降了六倍。
同一年还有一份研究,结论更狠:在基准测试上,Coding Agent 的 Harness 设计,比模型的大小更能决定成绩。
说人话:模型是发动机,Harness 是整车——方向盘、油门、刹车、导航。
打个我们干供应链的比方。你有一台五百马力的发动机,装在拖拉机上,它跑不过一辆调校好的家用车。排量决定的是上限,整车决定的是你实际能开多快。而我们大多数人换工具,换的全是发动机——今天听说某个模型强,明天听说另一个版本好,后天去抢某个新 Agent 的内测码。
真正决定你产出的,是另外三件事:
第一,你给的上下文够不够——相当于导航里有没有输目的地。
第二,任务拆得对不对——相当于路线规划得合不合理。
第三,有没有反馈循环——相当于开错了能不能及时修正,而不是一路开到沟里。
我的做法是:给 AI 的从来不是一句话,是一份"背景包"。
比如我要做一份出海研究报告,会先跟它说清楚:这份东西给谁看——是给政府看的、给会员企业看的、还是给投资人看的;我们这个协会服务的企业是什么样的体量、在哪个阶段;哪些数据必须标来源、哪些话不能说;最终要什么格式、多少字。这一整套背景,我早就固化成了几个模板。换模型?换工具?模板直接带过去,几乎不用重学。
所以我的第二个判断是:你换十个模型的收益,很可能不如把一件事的上下文给对一次。
◆ ◆ ◆
三、假快与真快:提效的分水岭是"一次通过率"
TRAE Work 有个在横评里被反复提的毛病,我特别喜欢拿它当教材:它什么都给你做成网页。
你让它写周报,它交给你一个网页;你让它做 PPT,它交给你一个带快捷键切换主题的 HTML。公平地说,它信息规范性做得是同类里最好的——每条动态都标了来源,还能跳转。但格式不对,你还得自己重做一遍。速度优势,直接被返工抵消。
这个例子把"假快"说得太透了:效率在生成端赚的,在返工端又亏回去了。
所以我现在不看"AI 有多快",我看一个公式:
真实提效 = AI 产出速度 × 一次通过率
一次通过率 30% 的"快",不如一次通过率 80% 的"慢"。这个道理,做过工厂的人都懂——你宁可要一条慢一点但良品率高的产线,也不要一条飞快但次品堆成山的产线。
百度搭子 8 月 27 日那场发布会提了个词,我很认同:"交付即惊艳"。他们还做了一个叫 DuMateBench 的榜单,是行业第一个评测智能体"真实交付能力"的开放共创榜单,首批纳入两百多个真实办公任务。注意关键词——不是"生成能力",是交付能力。一家公司愿意把钱和声誉押在"交付"这两个字上,说明行业已经摸到真正的瓶颈在哪了。
我的做法是:给 AI 定"验收标准",而不只是定"任务"。
比如我要一份某国跨境电商政策的分析,我会先把话说死:
给谁看——准备落地那边的会员企业负责人;多少字——两千字以内,不要写成长论文;什么格式——要点式,每条结论后面必须跟一句"对企业意味着什么";数据来源——官方公告优先,媒体解读要标注,不许编数字;边界——不涉及政治评价,只讲商业影响。
这跟我们做供应链管理是一个道理。没有验收标准的交付,等于没有交付。你去工厂验货,不可能只说"把货做出来",你得给图纸、给公差、给抽检标准。对 AI,一模一样。
◆ ◆ ◆
四、每一次使用,都应该留下一份资产
这一条,是我这两年最值钱的经验。
先看几个信号,你就知道行业在往哪走。
WorkBuddy 提了个概念叫"企业 AI 资产"——把企业知识、专家经验、系统连接器、标准化流程,沉淀成可复用的资产。业务人员不需要懂研发,用自然语言就能建自己企业专属的智能体。
百度搭子做了个功能叫"搭子时刻"——你不光能分享成果,还能分享"这个成果是怎么做出来的",让别人直接复用你的工作步骤。
DeepSeek 的 DSH 是"一切皆插件"——模型、工具、技能、会话、存储全是插件,能自由替换重组。它甚至能把 Claude Code 和 Codex 装进来当"子代理",让一个 AI 指挥一群 AI 干活。
龙虾的技能机制更朴素——它每天把自己的行为写进 markdown 文件,下次执行前再读一遍。彼得这么设计的理由很简单:这样"技能"就不用每次重新生成了。
看出共同点了吗?所有跑在前面的工具,都在解决同一件事:让上一次的努力,能变成下一次的起点。
我把沉淀分成三层:
第一层,提示词模板。凡是问过三次以上的问题,一律固化成模板。这是最便宜的一层,也是回报最快的一层。
第二层,背景包 / 知识库。行业术语、企业资料、政策口径、禁忌清单。这一层决定 AI 说话像不像"你们公司的人"。
第三层,技能 / 流程。把多步骤任务固化成可复用的工作流。这一层最难,但也最值钱,因为它直接对应"组织能力"。
第三个判断,也是最容易被忽略的一个:用了 AI 但没沉淀,等于每天在重复交学费。这不叫提效,叫租用效率——你付了钱、花了时间,但什么都没留下。
我们做供应链的,都懂一个词叫"规模效应"——量上去了,成本就摊薄了。AI 这边对应的那个词,叫复利效应:不是量摊薄了成本,而是每一次使用,都让下一次变得更便宜。
◆ ◆ ◆
五、别追工具的版本号,追你企业的版本号
聊到这儿,我想把一个更要紧的东西摆出来。
我们天天盯着工具的版本号——今天是 V4,明天是 5.6,后天又冒出来一个新名字。但我想问一句:你企业的版本号,是多少?
这两年我看了不少企业上 AI,慢慢摸出一个规律:企业用 AI 这件事,是可以分版本的。而且这个版本号,跟工具的新旧一点关系都没有。
企业版 V1.0 · 追新型。特征是收藏一堆工具、抢内测码、比参数、群里转"某某模型又升级了"。判断标准很简单:你的 AI 能力跟着工具走,工具一换,你就得重学一遍。大多数企业和个人,都停在这一版。
企业版 V2.0 · 会用型。特征是公司里少数几个人——往往是老板自己,或者几个年轻人——能把 AI 用起来,产出还不错。但没有标准、没有沉淀。判断标准同样简单:离开了那几个人,能力直接归零。这一版比 V1.0 强,但脆弱。
企业版 V3.0 · 沉淀型。特征是有模板、有背景包、有知识库,一次通过率明显上来了。判断标准是:新人拿过去就能用,产出质量稳定,不再依赖某个"高手"。到这一版,AI 才真正开始变成公司的一项能力,而不是某个人的手艺。
企业版 V4.0 · 进化型。特征是 AI 已经嵌进流程——有统一下发的流程、模板、检查项,个人的沉淀能变成团队的资产,数据能越用越准。判断标准是:AI 一旦撤走,流程会卡住。换句话说,AI 已经长进了你的组织里。
这四个版本,跟工具的新旧没关系,跟你投了多少钱关系也不大。它只跟一件事有关:你有没有在每一次使用之后,留下一点东西。
我见过用着最新工具、却还停在 V1.0 的企业;也见过就用一两个常规工具、已经摸到 V3.0 的团队。差别不在工具,在方法。
所以如果你问我,这一轮 AI 浪潮里企业最该盯的那个数字是什么——不是 V4,不是 5.6,是你自己企业的那个版本号,这个月往上走了没有。
◆ ◆ ◆
六、个体提效之后,是组织进化——给出海企业的一句提醒
先看两个数。
第一,国内 AI 办公桌面端的月活大约 3000 万。听着不小,但据行业测算,相比传统办公软件,它还有约 20 倍的增长空间。
第二,百度集团执行副总裁沈抖说:未来 90% 的工作,都可能有智能体深度参与。
两个数放在一起,结论很直白:绝大多数人,还没有真正把 AI 用进自己的工作流。所有人都在谈 AI,但真正每天让 AI 干活、而且干成了的,是极少数。
所以眼下最真实的风险,不是"AI 会不会取代你",而是"会用 AI 的同事已经把你甩开了"。但请注意——这个"会用",不是在对话框里问一句,而是能把 AI 嵌进流程。
落回我的本行。8 月中旬腾讯在成都那场供需对接会上,有个数字我记了很久:制造业质检环节,智能校核把检验报告的校核时长从 2 到 4 小时,压缩到 5 到 10 分钟。同一场活动还提到,在跨境电商领域,AI 正在推动组织从"个体提效"迈向"组织进化"。
两到四个小时,压到五到十分钟。放到出海的语境里,这不是省了几个工时,这是交付速度的代差。
我们做跨境电商、做品牌出海,拼到最后拼的是什么?不是谁嗓门大,是同样的品质,你能不能更快交、更便宜交、更稳地交。而 AI 正在把"更稳地交"这件事的门槛,整体往下压了一大截。会用 AI 的出海企业,和不会用的,三年后大概率是两个物种。
给企业三条建议,都很土,但管用:
第一,别全员铺工具,先挑 3 个高频场景打透。铺得越广,死得越快。就挑最痛的、最重复的、最容易验收的三件事。
第二,别追新,先把一个工具的上下文和验收标准调到 80 分。80 分的旧工具,远远胜过 30 分的新工具。
第三,每个月盘点"沉淀了什么",不是"用了多少次"。使用次数是成本,沉淀下来的才是资产。
◆ ◆ ◆
最后说一句
这两年我最大的体会,其实就一句话:
别追版本号了。你要追的,是下周一那份报告能不能一次过。
工具会一直换。龙虾会蜕壳,TRAE 会改名,Codex 会加新模式,明年还会有叫不出名字的新东西冒出来。工具的版本号会一直往上跳,但那跟你没关系——你要盯的,是你企业那个版本号。而有三件事,换一百代工具都不会变:
把一件事说清楚——这是上下文。
把标准定明白——这是验收。
把经验留下来——这是沉淀。
这三件事,跟 AI 没关系,跟做事有关系。AI 只是把它们的回报率,放大了十倍。
我做供应链二十多年,亲眼看着年富、润泰、腾邦这些百亿级的公司一个一个倒下。它们倒下的原因各不相同,但有一点是共通的:在顺风的时候,把行业的红利,误当成了自己的能力。
今天用 AI 也是一样。模型变强、工具变多,那是行业的红利。你能不能把这份红利真正变成自己的能力,取决于你是在追工具的版本号,还是在升你自己企业的版本号。
工具是浪花。你是船。





















