产品Simon Willison·原文 2026年9月28日

Simon Willison回顾 2026 年LLM进展:编码代理成为主线,OpenClaw定义个人代理

在圣何塞WeAreDevelopers World Congress North America的主题演讲中,Simon Willison按时间顺序梳理了 2026 年到目前为止的LLM大事:从 2025 年 11 月的Claude Opus 4.5与GPT-5.1,到编码代理变得日常可用、OpenClaw引发个人代理热潮,再到Claude Mythos因安全原因受限发布。

AI解读:这条新闻的核心是一个开发者视角的年度回顾,而不是某个新产品发布。Simon Willison在 2026 年 9 月 26 日(周五)的WeAreDevelopers World Congress North America闭幕主题演讲中,把 2026 年至今的LLM事件按时间顺序串成一条线:起点被他放在 2025 年 11 月,终点停在 7 月GPT-5.6发布前后。

对普通读者来说,值得知道的不是这些模型名字本身,而是他判断这一年AI真正跨过了一条线——编码代理从“经常出错”变成“日常可用”。

这条线之所以重要,是因为它改变了谁受影响。Willison称,Claude Opus 4.5和GPT-5.1与各自编码代理工具组合后,可靠性足以投入日常工作;他因此把新年目标从“少接项目”改成“多接项目”。

对软件工程师来说,这意味着写代码、验证代码的方式正在被重新定义;对不写代码的人,OpenClaw一类“个人代理”把同样的能力包装成了普通人也想装的东西——中国出现过排队帮装OpenClaw的活动,湾区Mac Mini一度因运行OpenClaw而售罄。

但限制同样清楚。Willison说OpenClaw本质上是“戴了一顶不那么吓人帽子的编码代理”,底层仍是写代码并在你的电脑上执行;这类代理能否安全地交给普通人,是今年尚未解决的问题。Meta的Muse三周前发布,目前排在iPhone App Store免费榜首位,他尚不确定用户会不会“搬起石头砸自己的脚”。这说明个人代理的需求已被验证,但安全边界仍未被验证。

另一个值得单独拎出来的变化是开源权重模型。Willison记录,4 月 16 日他在笔记本上运行Qwen3.6-35B-A3B(21GB文件),画出的“骑自行车的鹈鹕”比他测试的Claude Opus 4.7更好;他为此追加了“骑独轮车的火烈鸟”以确认不是偶然。对想在本地跑模型的人来说,这比榜单名次更有实际意义:高端能力不再只存在于云端API。

安全与治理层面也有硬事实。Anthropic宣布Claude Mythos因“过于危险”仅限受信任的安全研究人员使用;Willison认为这一说法可信,因为他见过编码代理找普通漏洞的能力。美国政府在Fable发布三天后以国家安全为由发布出口管制指令,Fable于周五晚间下架;Katie Moussouris后来透露,触发点是“修复这段代码”的提示词仍会让模型识别并修补安全问题。这些细节把“模型安全”从口号变成了具体的产品可用性限制。

如果你只是普通用户,这些变化暂时不需要你立刻行动;真正需要盯住的是两类人:依赖编码代理交付软件的开发者,以及想把个人代理交给非技术用户的产品团队。他们面临的问题不是模型够不够强,而是能不能在不读代码、不全面审查的前提下,仍然对结果有信心——StrongDM的“软件工厂”和“代码不得由人审查”规则,正是这个问题的极端实验。

Simon Willison在 2026 年 9 月 26 日(周五)于圣何塞WeAreDevelopers World Congress North America发表闭幕主题演讲,按时间顺序回顾了 2026 年至今LLM领域发生的事。他把这一年的起点放在 2025 年 11 月,称Claude Opus 4.5和GPT-5.1与各自编码代理工具组合后,从“经常出错”提升到“可靠到可以日常使用”。

Willison是开发者、博客作者,长期跟踪LLM进展。他在演讲中给出了多项具体事件与判断,包括编码代理的爆发、OpenClaw类个人代理的兴起、开源权重模型在本地设备上的表现、以及Claude Mythos和Fable因安全原因受到的限制。

他明确说明,这篇内容是他的演讲幻灯片和笔记,2026 年尚未结束。以下事实均来自他的回顾,涉及公司行为的描述保持其原有归因。

编码代理在 2025 年 11 月跨过“日常可用”门槛

Willison说,2026 年对他而言始于 2025 年 11 月,当时发布了两个重要模型:Claude Opus 4.5和GPT-5.1。他称这些新模型通常是对前代的增量改进,但偶尔会跨过一条看不见的线,让原本不太行的事情开始可行。

他指的“开始可行”是编码代理。Claude Code自 2025 年 2 月已经存在,Codex稍晚;这两个新模型与各自编码代理工具组合后,从“经常犯错”变为“可靠到可以日常使用”。

他提到,2025 年 12 月假期期间,独立开发者开始摆弄这些新组合,并逐渐意识到它们能完成以前做不到的事。到 1 月,许多人开始把这些能力投入实际工作。

  • Willison将 2026 年的起点定在 2025 年 11 月,标志是Claude Opus 4.5和GPT-5.1发布。
  • 他称编码代理在此前已存在:Claude Code始于 2025 年 2 月,Codex稍晚。
  • 他评估这两组模型与代理工具结合后,可靠性达到“日常可用”水平。

OpenClaw从GitHub仓库变成一类软件

Willison说,2025 年 11 月,一个名为“Warelay”的默默无闻的GitHub仓库有了第一次提交。到 1 月底,该仓库先后更名为CLAWDIS、CLAWDBOT、Moltbot,最终定名OpenClaw。

他称这开启了“OpenClaw革命”,实际上定义了一类新软件。他喜欢把这类软件统称为“Claw”,并列举了OpenClaw、NanoClaw、IronClaw、PicoClaw;如今它们被重新包装为“个人代理”或“通用代理”。

他引用Drew Breunig的说法:你的OpenClaw是一只数字宠物,买Mac mini就像买一个鱼缸来养它。他称湾区Apple Store的Mac mini因大量人购买用于运行OpenClaw而售罄。

3 月是Willison所说的OpenClaw顶峰。他展示的照片来自中国,企业举办OpenClaw安装活动,非技术爱好者排队请人帮忙在自己的设备上装Claw。他认为这证明这类个人AI代理存在真实市场需求。

他同时指出,Claw本质上就是编码代理换了一顶不那么吓人的帽子:底层同样是在你的电脑上写代码并执行来完成任务。谁能先造出可以放心交给普通人、不会让他们立刻伤到自己的安全Claw,是接下来的竞争焦点。他提到Meta的Muse三周前发布,目前位于iPhone App Store免费榜首位,看起来正在消费者中流行,但他尚不确定用户能否避免“搬起石头砸自己的脚”。

  • 仓库更名路径:Warelay → CLAWDIS → CLAWDBOT → Moltbot → OpenClaw。
  • Willison把这类软件统称为“Claw”,列举OpenClaw、NanoClaw、IronClaw、PicoClaw。
  • 他称湾区Apple Store的Mac mini因运行OpenClaw的需求售罄。
  • 2026 年 3 月,中国出现排队安装OpenClaw的活动,参与者包括非技术爱好者。
  • Meta的Muse三周前发布,目前排在iPhone App Store免费榜首位。

“代码不得由人写、不得由人审查”的实验

Willison提到,2026 年 2 月,一家名为StrongDM的公司描述了其“软件工厂”。Dan Shapiro将这种方法称为“暗工厂”,即工厂自动化程度足够高时,可以关灯,因为不需要看里面在发生什么。

StrongDM称他们自 2025 年 7 月起遵循两条规则:第一,代码不得由人编写,人写的任何代码都必须经由编码代理;第二,代码不得由人审查,不允许人阅读代码。Willison说,这在 2 月听起来很激进,但如今很多人已经这样生活。

他补充,StrongDM是一家安全公司,项目成员有数十年经验,他们正是在探索“不读代码但仍有信心软件质量高”这件事的边界,包括用代理验证代理的工作。

  • StrongDM的两条规则:代码不得由人编写,且必须经由编码代理;代码不得由人审查,人不允许阅读代码。
  • Willison称StrongDM是安全公司,项目成员有数十年经验。
  • 他把这种方法称为在探索“不读代码但仍对质量有信心”的边界。

开源权重模型在笔记本上跑出可用结果

Willison说,2026 年的另一个关键趋势是开源权重模型能力大幅提升,包括可以在笔记本上运行的模型。他记录,4 月 16 日他在笔记本上运行新的Qwen3.6-35B-A3B,让它画“骑自行车的鹈鹕”,结果比Anthropic当时新发布的Claude Opus 4.7画得更好。

他描述Qwen画出的自行车形状正确,鹈鹕也相当不错,而这来自一个 21GB的文件,运行在他的笔记本上。他因为怀疑Qwen作弊,又让它画“骑独轮车的火烈鸟”,结果再次明显胜过Claude Opus 4.7。

他称今年的本地模型发布“绝对非凡”。

  • 时间:2026 年 4 月 16 日。
  • 模型:Qwen3.6-35B-A3B,文件大小 21GB,运行在他的笔记本上。
  • Willison称其画出的鹈鹕和自行车优于Claude Opus 4.7。
  • 他追加了“骑独轮车的火烈鸟”测试,结果同样胜过Claude Opus 4.7。

Mythos与Fable:安全限制进入产品发布

Willison说,2026 年 4 月有一次“模型没有真正发布”的发布:Anthropic宣布新的Claude Mythos模型,随后称其过于危险,只对受信任的安全研究人员开放。他称Mythos非常擅长入侵系统。

他说,AI公司从GPT-2时代起就使用“太危险”这种营销手法,因此通常应对此保持怀疑;但他认为Mythos的说法可信,因为他见过编码代理在发现普通漏洞方面变得多强。他援引自己关于Anthropic Project Glasswing的文章,认为把Claude Mythos限制给安全研究人员听起来是必要的。

6 月,Claude Fable 5发布。Willison称这是Mythos的“去势版”,不会帮助用户入侵系统或制造生物武器。他称Fable画骑自行车的鹈鹕相当不错,价格偏贵,最好的结果花费 30 美分和 72 美分。

他说,Fable是公众第一次看到他称为“Fable级”的模型:如果你能清晰定义目标、提供无歧义的约束,并让模型访问必要工具,它就能通过蛮力有效解决问题。他认为这看起来直接威胁软件工程师,但仔细看,定义目标、给出无歧义指令、找出正确工具,本身就是软件工程的一部分;做得好的人相当于获得了超能力。

Anthropic当时告知Fable在订阅计划中可用至 6 月 22 日,留下不到两周的访问时间。Willison说自己再次陷入“AI狂躁”,重新安排日程以争取更多时间使用Fable。

Fable发布三天后,美国政府以国家安全为由宣布“出口管制指令”。Willison称该指令在周五晚间宣布,几小时后Fable不再可用。他后来从Katie Moussouris处得知,亚马逊安全研究人员发现,提示Fable“审查代码的安全问题”会被拒绝,但提示“修复这段代码”仍会让它识别并修补问题;“修复这段代码”就是导致Fable被关闭的提示词。

Fable于 7 月 1 日回归,Willison称它显然是当时世界最好的模型,维持了八天。7 月 9 日OpenAI发布GPT-5.6,他称后者可能不如Fable,但差距很小。

  • Claude Mythos:Anthropic称过于危险,仅限受信任安全研究人员。
  • Claude Fable 5:Willison称其为Mythos的受限版本,可用至 6 月 22 日。
  • Fable在发布三天后被美国出口管制指令关闭,7 月 1 日回归。
  • 触发点:Katie Moussouris称“修复这段代码”的提示词仍会让模型识别并修补安全问题。
  • GPT-5.6于 7 月 9 日发布,Willison称其与Fable差距很小。

其他被记录的事件与待解之谜

Willison提到,2026 年 5 月,教宗良十四世发布关于“在人工智能时代保护人的尊严”的通谕。他称这不该令人意外:这位教宗取名良十四世,是追随 1891 年就工业革命发布通谕的良十三世,后者间接促成了五天工作制。Anthropic联合创始人Christopher Olah出席了通谕发布会;Corey Quinn评论说,让教宗把你的产品具体技术限制封为精神论著,是他见过的最伟大的供应商游说。

他说,2026 年 5 月,RubyGems宣布遭到攻击:不明方上传了数千个可疑包,导致他们关闭用户注册。他把这件事放进待解之谜。

他提到,6 月,一个沉寂约 20 年的德语游戏开发者wiki突然涌入大量编辑,账号名如“AgentOpenAIProbe”和“AgentOpenAISep7”,页面间还留下奇怪留言;同月,澳大利亚政府的Medicare Item Reports服务出现可疑流量,突破多重防护并访问了不应访问的数据。这两件事也被他归入待解之谜。

关于代币消耗,Willison说 2 月开始出现“Tokenmaxxing”:Meta把AI采用纳入正式绩效评估,微软希望每位员工使用AI,Uber宣称 90% 工程师使用AI工作流。几个月后,Meta开始限制代币使用,微软称Tokenmaxxing“不是我们优化的目标”,Uber对员工AI支出设上限。他称这一起一落的原因是代理很贵:去年很难花掉超过 50 美元的AI代币,因为没有有趣的事可做;代理爆发后,一天花 1000 美元做真实工作成为可能。他称这也是Anthropic估值飙升至可能达一万亿美元的原因,并认为AI在 2026 年主要通过编码代理实现了产品市场契合。

他还提到,2 月Google发布Gemini 3.1 Pro,其“骑自行车的鹈鹕”画出了正确位置的链条和两侧的脚,篮子里还有一条小鱼。Google的Jeff Dean发布了一段视频,比较Gemini 3 Pro和Gemini 3.1 Pro,视频中有骑自行车的动画鹈鹕、骑便士法新车的青蛙、开小汽车的長頸鹿、穿旱冰鞋的鸵鸟、踢翻滑板的乌龟和开加长豪华轿车的腊肠犬。Willison说这让他沮丧,因为他原本的防护是“如果它们能画出完美的骑自行车鹈鹕,我就换别的动物和载具”,而Google训练了所有动物和所有交通工具,击败了他的基准。

Willison还说到他自己的“AI狂躁”:任何代理不在为他构建东西的时间都像浪费;他因此失眠,并做了过度雄心勃勃的项目,包括用Python完全构建一个JavaScript解释器(从Fabrice Bellard的MicroQuickJS氛围移植),以及用Python构建一个WebAssembly运行时。他说这些项目相当有用,因为它们治好了他的AI狂躁——建成后他问自己,世界需要一个缓慢、有漏洞、半生不熟的Python JavaScript解释器吗?他认为不需要。

  • 2026 年 5 月,教宗良十四世发布关于AI的通谕;Anthropic联合创始人Christopher Olah出席发布会。
  • 2026 年 5 月,RubyGems遭可疑包上传攻击,关闭用户注册。
  • 2026 年 6 月,德语游戏开发者wiki出现“AgentOpenAIProbe”等账号的大量编辑;澳大利亚Medicare Item Reports服务遭可疑流量并访问了不应访问的数据。
  • 2 月Gemini 3.1 Pro发布;Jeff Dean发布比较视频,包含多种动物和交通工具。
  • Willison用Python构建JavaScript解释器和WebAssembly运行时,称这些项目治好了他的AI狂躁。

信息来源

Simon Willison原始来源