<aside> 💡
受真格基金邀请,参加了一场 🦞 小龙虾养殖交流会,讨论了几点关于 OpenClaw 的养殖心得,同步记录下今天分享的几个浅薄观点。
</aside>
我们最近越来越频繁地看到一个有意思的 UI 选项:「我是 Human」/ 「我是 Agent」。这看起来只是一个简单的入口选择,但它背后其实意味着一件很重要的事情:互联网正在出现一种新的用户 —— AI Agent。
当 Agent 开始替人类浏览网页、调用 API、完成任务,人类在系统中的角色也在发生变化:我们不再是执行者,而更像是一个给出目标的管理者。
但与此同时,一个副作用也正在出现 —— 人类对系统运行过程的理解,正在快速塌陷。

从 Moltbook 到 SkillHub,越来越多的网站和应用已经在 UI 上同时提供两种入口:「我是 Agent」和「我是 Human」。甚至已经出现了一批专门面向 Agent 使用的产品。可以预见的是,未来几乎所有互联网产品都将面临一个新的选择:要不要让第三方 Agent 进入你的系统。
我的判断是,未来很可能会出现明显的两极分化,形成两种不同的生态。
一类是拥有存量内容资产与关系链的产品(例如小红书 / 微信 / 抖音)。这类平台出于商业与生态控制的考虑,大概率会变得更加封闭,对第三方 Agent 持抗拒甚至封禁态度。
另一类则是开源生态和一些新产品。它们可能会更欢迎 Agent 的进入,甚至主动为其提供 MCP、Skills、Agent SDK 等基础设施。谁先成为 Agent 的基础设施,谁就会成为新的平台。
我们今天教 OpenClaw 使用浏览器时的艰难,本质原因在于:LLM 缺乏对「像素世界」的物理理解。
OpenClaw 在 2026.3.13 版本中显著强化了浏览器自动化能力,但本质问题并没有改变:Agent 仍然强于逻辑推理(文本),弱于空间感知(UI 布局)。
因此,未来真正的突破口可能并不在于更多 API、MCP 或 Skills,而在于更强的 Vision-Language-Action(VLA)模型。从更宏观的角度看,其实就是一个真正可用的世界模型。
当 AI 能像人类一样理解屏幕上的每一个按钮、每一个界面元素,以及它们背后的交互逻辑时,人类在教 AI「点这里、点那里」时的痛苦才会真正消失。

一个不可否认的事实是,从各类 Chatbot 到 Cursor、Claude Code,再到 OpenClaw,AI 的执行力越来越强大,但人并没有变得更轻松,至少对于 AI 从业者、创业者、创作者而言如此,许多媒体人也有类似的感受。有一个媒体人在朋友圈里写道:
目前而言,丝毫没有装不装龙虾的焦虑,只有龙虾稿子写不完的焦虑。
关于这个问题,我已经在前面的文章中有所展开,可玉步:
对于一个 AI 用户而言,在可预见的未来,我们仍然需要不断地调教、训练、甚至去「鸡」我们的 Agent: