上周三晚上十一点,我让Claude帮我处理一批公众号后台的留言数据,然后就去厨房泡咖啡了。
等我端着咖啡回来,屏幕上密密麻麻滚着字。它自己装了pandas,自己读了我的CSV,发现编码不对又自己改成了utf-8,跑出来一张图说我最近的读者里有32%是新关注的,建议我下一篇写点门槛低的内容。
我愣了两秒,端着咖啡没喝。
不是因为它做完了这件事,这件事三个月前的GPT也能做。让我愣住的是那个建议,是它自作主张帮我多想了一步。它在我没问的时候,给我递了一个我本来该自己想的问题的答案。
那一瞬间我意识到,工具和助手的边界,真的在塌了。
过去两年,AI圈最常用的一个词叫copilot,副驾驶。这个词其实挺谦虚的,意思是你开车,我帮你看导航递水。Cursor早期就是这个调调,你写一行它补半行,你想不起来某个API它给你提示一下,归根到底还是你在主导。
但2025年下半年开始,整个赛道的口风变了。
最先变的是写代码这一块。Cursor自己出了一个Agent模式,你说一句「把登录页面改成深色」,它自己去翻代码、自己改文件、自己测试、自己commit。Anthropic推的Claude Code更狠,直接跑在终端里,没有图形界面,你像跟一个程序员同事打字聊天一样下指令,它在你电脑上像幽灵一样干活。
我身边好几个独立开发者,已经把Claude Code当作主力。一个朋友跟我说,他现在写代码的时间从过去每天八小时降到两小时,剩下六小时在干嘛,在审稿,在review AI写的东西,在想下一个产品做什么。他的角色从码农变成了产品经理加技术总监。
这不是工具升级,这是工种变了。
然后是创作和分析这一块。今年开年最炸的是Manus,一个国内团队做的通用Agent,演示视频里它能自己打开网页、自己填表、自己下载文件、自己整理成Excel发邮件。视频火到什么程度,邀请码在闲鱼炒到上千块一个。后来字节的扣子空间、Genspark的Super Agent、阶跃星辰、智谱、月之暗面,一窝蜂全跟上了。
OpenAI那边也没闲着,Operator能直接接管你的浏览器,Anthropic的Computer Use能直接控制鼠标键盘,像个真人一样在你电脑上戳戳点点。
如果你只是从演示视频看,你会觉得这些东西差不多。但真用起来差距巨大。
坦率讲,目前为止真正能稳定干活的Agent,主要还是垂直场景。编程是一个,因为代码有明确的对错,能编译能测试,闭环短。深度调研是一个,因为信息检索和总结本来就是大模型的舒适区。还有一些客服、运营、数据处理的细分场景。
那些号称什么都能干的通用Agent,演示惊艳,实战拉胯。你让它帮你订机票,它能给你订到下个月的同名城市去;你让它帮你整理收件箱,它会把重要邮件归到垃圾里。
为什么呢,因为通用Agent要解决三个超级难题,理解你模糊的需求,规划合理的步骤,在真实世界里不出错地执行。这三件事,每一件单拎出来都是博士论文级别的难度。
那为什么我还是觉得2026年值得一个「Agent元年」的名头?
因为有几个底层的东西在2025年底悄悄齐活了。
第一个是模型的推理能力。GPT-5、Claude Sonnet 4.5、Gemini 3、国内的DeepSeek R2、Qwen3,这一批模型都把long-horizon reasoning也就是长链条推理打通了。过去AI做三步以上的事就开始飘,现在能稳定做几十步几百步而不崩。这是Agent的地基。
第二个是工具调用的标准化。MCP协议,模型上下文协议,今年下半年几乎成了行业默认。意思是不管哪家的模型,都能用同一种姿势调用外部工具。这一步看着不起眼,相当于给Agent装上了万能插座。以前每个Agent要单独适配每个软件,现在大家说同一种语言了。
第三个是浏览器和操作系统层的开放。Anthropic的Computer Use、谷歌的Project Mariner、苹果在新版iOS里也悄悄给Siri留了Agent接口。AI终于可以名正言顺地控制你的电脑和手机了,不用靠那些奇技淫巧。
第四个是成本崩了。今年初Claude跑一小时Agent大概要花三十块人民币,年底降到三块。明年这个数字大概率是三毛。当一个Agent帮你干一小时活的成本低于一杯奶茶,整个商业模式就成立了。
地基、协议、入口、成本,四件事都到位了。这不是哪一家公司的功劳,是整个行业的合力。所以我说
BossAgents