zbo智博1919com

起源:孙颖莎女单首轮3-0横扫晋级作者

起源:孙颖莎女单首轮3-0横扫晋级作者: 陈志桦:

Fable 5解禁即上岗,工程师转业当「验收员」

新智元报道

【新智元导读】Fable 5刚解禁就接入了Claude Tag。往后最吃香的,不再是最会写代码的人,是最会验收AI干活的人。

Fable 5刚被放回,就接入Claude Tag,住进工作群,造成一个能连着跑好几天、还会自己给你发PR的同事。

你不用再守着它补全下一行,只管派下一个活。

从前,一小我坐在那儿,一次敲一行代码:罄矗恍∥掖攀鯟laude,一次写一堆职能。

而此刻,方向盘直接递到了Claude手里,坐在它对面的也不再是一小我,是一整个团队。

Claude,从一辆车,造成了开车的人。

Boris Cherny回顾AI辅助编程的两次跃迁:从前一小我对着屏幕一次敲一行代码,此刻一小我身边带着十来个Claude,一次并行写一堆职能。(图源:Anthropic官方视频)

Claude Code之父Boris Cherny说:

有了Tag,它把整件事全干了。写完一个职能,端到端跑完一个尝试,连数据分析都包了。两年,跨了两大步。

两年前,Boris还在用输入遐想(typeahead)写代码。AI帮你补半行,这行怎么落,还得你自己拍板。

今天,他手上跑着几十个Claude Tag会话,有的连着跑了几天,有的跑了几周。

他每天做的事,就是看着PR一个一个提上来,看着数据一份一份发过来。

Boris甩出的一个数字更狠:产品团队65%的代码,此刻由内部版Claude Tag写出,并且这个比例还会持续攀升。

这个65%,是「代码占比」,并非「65%的PR自主实现」。

但它已经够注明问题:Anthropic内部,「@一下AI派活」已经造成主流的干活方式。

一小我也能占有一支Claude小队

6月23日,Anthropic把Claude Tag扔进了Slack。

最大的一个变动:你手里的AI不再是一个工具,而是一个能替你干活的队友。

Anthropic官方演示中,@一下Claude即可派活。(图源:Anthropic官方视频)

官方给Claude Tag的定位不是又一个谈天机械人,而是Claude Code的一次演进。

从此,Claude Code、Claude Tag、Fable 5,三条产品线,各干一摊。

Claude Code就像个专一干活的教员傅。

它管的是「改代码」,是面向开发者的智能体编码工具(agentic coding tool),能读懂你的代码库、编纂文件、修bug、跑测试。

你把代码库丢给它,它闷声不响就改好了。

Claude Tag是群里那个揽活的工头。

它管的是「派工作」,你在Slack群里@一下Claude,说清要什么,它就把工作拆成几个阶段,一段一段往下推,挪用它有权限的工具。

干完,在Slack线程里回你一句它办成了啥。

Fable 5是全队的体力兼脑力担任。它管的是「能扛多重的活」,是这三个中的大脑。大型迁徙、复杂重构、要连着跑好几天的工作,都能顶上。

前两个把台子搭好,真正把重任挑起来的就是它。

三个凑一块,就等于一小我有了一支Claude小队。

前两个都是壳

Fable 5才是发起机

Claude Tag是入口,Claude Code是手脚,真正让它敢接长活的,是底下的大脑Fable 5。

它到底比此外模型强在哪?答案是:它能自己把一件大事重新扛到尾。

在Claude Code这类智能体运行框架(agent harness)里,Fable 5能连着跑好几天(work for days at a time)。

它自己排布几个阶段的活,忙不外来就把子工作甩给子智能体,最后还回头把自己干的查抄一遍。

工作越长越复杂,它甩开其他模型的差距就越大。

Cherny还在官方视频里泄漏了一个数字:按最新的METR评估,前沿模型的自主工作时长已经爬到16小时这条线左近,甚至进了「连它到底能跑多久都测禁绝」的区间。

分歧模型能以50%成功率实现的工作时长,六年间沿指数曲线一路爬升。图顶斜纹区标注:超过16小时的丈量,现有工作集已经测禁绝了。(图源:METR)

而在Claude Tag里,模型能给自己排后续的活,一个16小时的工作,能够被它自己续到几天、几周之后再接着干。

这里必要把稳的是,长工作能力,并非单纯模型的业绩。

这一点,Anthropic在自己的工程博客里讲得很透辟。

持久运行的智能体最大的坎,是它只能分段干活,每开一个新会话都失忆,就像一个工程项目轮班倒,每个新来的工程师都不记得上一班干了啥。

光靠高低文压缩(compaction)不够,模型要么想一口气把整个app写完,中途撑爆高低文;要么看一眼有进展,就颁发「落成」。

Anthropic的解法是给它配一套「班组交代」的机制:一个初始化智能体先搭好环境,写好进度文件和职能清单。

后面每个编码智能体只干一件事,干完把进度提交到git、写明显交代注明,再交给下一班。

所以真正的变动是「模型+框架+工具链」的系统能力。

Fable 5干的事,是把这套系统的上限,从小时级耽搁到了天级。

PR成了新的交付单元

当然,对于通常开发者,也先别急着把整个代码库交出去。

一个正确的打开方式,是先把那些低风险、天堑清澈、有测试可验收的活,切成一个个工作交给智能体跑。

在Anthropic那条介绍Claude Tag的官方视频里,用法都是一些很日常的场景。

Boris自己说,他平时用得顺手得很。谁报个bug,按钮偏了几像素,他一句「帮我修一下」就甩从前;碰上个数据问题,扔给Tag先跑一遍就完事。

而那些跑了好几天的会话,性质是一个持久尝试:Tag每天替他查数据,偶然冒个bug就顺手发个修复,PR自己就一个个提上来了。

因而,这里有一个关键的使用分水岭,并非你敢不敢把活全交给AI,而是你会不会把工作切成AI能验收的颗粒度。

给AI派活的最小单元,正在从一个函数,造成一个PR。

新的门槛

不是prompt

当AI能跑多日工作、能自己提PR,人的价值挪到哪去了?

Anthropic给的答案是:工程师转向架构、产品判断和持续编排——并行管起多个智能体,给方向,做那些真正决定「要造什么」的决策。

但AI提上来的PR,终于要有人点下归并(merge),即把某个分支上的代码扭转并进主代码库,相当于给这份代码盖章放行、正式选取。

这意味着,法式员最稀缺的能力,也在偷偷扭转。

从前你比谁更会写prompt、更会问问题;往后你比谁更会写工作天堑、测试尺度、review清单和回滚规划。

写代码的门槛在降,验收代码的门槛在升。

下一个吃香的工种,可能是最会给智能体定验收尺度的人。

AI已经险些能把代码写完了。

剩下的问题只有一个:它写的代码,你敢不敢认,会不会认。

参考资料:

https://x.com/claudeai/status/2072725610061803522?s=20https://youtu.be/MhfnicQVkgY

https://www.anthropic.com/news/introducing-claude-tag

https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/

编纂:元宇

@韩维哲:小苮儿喊麦免费听mp3百度网盘,哈兰德中国粉丝数已超挪威全国人丁
@蔡宜齐:国乒男团3-0横扫日本队实现12连冠
@陈扬菱:中方强烈叱责巴基斯坦恐袭事务

热点排行

【网站地图】