Anthropic,也就是 Claude 系列 AI 模型背后的公司,最近公布了一个让不少人愣住的数字:自家大部分代码,按它自己的统计超过 80%,现在由 AI 写,不是工程师写的。公司把这称为迈向「递归自我改进」的进展。讲白一点,就是 AI 在帮忙造下一代 AI。
听起来像科幻片。但对一个正在犹豫要不要请软件团队、还是再等等机器人的马来西亚老板来说,这里有一个合理的疑问:如果 AI 会写自己的代码,那我为什么还要付钱请人写我的?以下是我们的老实看法,不加水分。
递归自我改进是什么意思?
递归自我改进是一个循环。更好的模型帮工程师更快写代码、跑更多实验、训练出更强的下一个模型。下一个模型又再把这套流程加快一轮。就这样一圈一圈转。
Anthropic 自己的图表能看出这条曲线有多陡。人均产出的代码量多年几乎没动,等它的 AI 编程工具成熟之后,突然往上跳。
每人每季贡献的代码量,图上标注了各代 Claude 模型的发布时间。来源:Anthropic。
这也不只是公司自说自话。IEEE Spectrum 在 2026 年 5 月报道了同一件事:Anthropic 表示自家大部分代码现在由它的 AI 写,人类负责指挥和验收。所以「AI 造自己」的温和版本,是真的来了。
AI 造 AI 强在哪里,又停在哪里
AI 有一件事做得非常好:给它一个讲清楚的任务,它能很快写出能跑的代码。那些简单、重复的活,成功率本来就高,现在还在往上走。
有意思的是另一类任务:目标模糊、开放式的,得有人来定什么才算「做好了」。
各类任务的成功率都在爬,但开放式问题还是落在简单任务后面。来源:Anthropic。
差距就在这里,故事也就在这里。Anthropic 还单独追踪一个问题:模型选的下一步,会不会比人选得更好?分数在进步,但这还是前沿,不是已经解决的事。
判断力,也就是选出更好的下一步,仍然是最难的部分。来源:Anthropic。
对大部分企业软件来说,写代码从来就不是瓶颈。瓶颈是决定要建什么、为什么建、愿意牺牲什么。AI 只是把容易的那部分变便宜了,难的那部分它没碰到。
这对马来西亚企业代表什么
我们给马来西亚公司做软件,每天用的就是这些工具。大部分代码由 AI 写,对我们不是威胁,而是一笔可以让给客户的折扣。以前要六个工程师的 app,现在两三个就能做完,省下来的钱是真的。
但要看清楚哪些事没变。你的 LHDN e-Invoice 对接,还是得符合 MyInvois 的规则,而 AI 并不了解你的生意。你的 PDPA 数据处理,还是需要一个懂马来西亚法律的人。你那套用了十二年的会计系统,还是得有人来决定它要怎么接上新东西。而当凌晨两点付款失败的时候,模型不会接电话,也不会承担责任。
最后这一点最要紧。你买的其实不是代码,是判断力和责任。AI 能很快生出看起来合理的代码,这也正是仔细审查 AI 写的代码变得更重要、而不是更不重要的原因。总得有个够格的人为结果负责。
递归自我改进是真的,还是炒作?
老实说,两者都有。温和的版本是真的,现在就量得出来。Anthropic 联合创始人 Jack Clark 公开给出 60% 的概率,认为 AI 能在 2028 年底前自主造出更好的自己。聪明人为这个数字吵得很凶。
我们的看法:那个「AI 一夜之间设计出超级智能」的剧本,还是猜测。不是猜测的,是已经在你手上、无聊但好用的那个版本。好的软件团队今年确实变快也变便宜了,就这样。赢的不会是等着戏剧性未来的企业,而是今天就找到一个把这些工具用得好的伙伴的企业。
所以不必担心软件公司会消失,也别信那些说 AI 已经不需要人来判断的人。判断力反而更值钱了。
三件现在可以做的事
- 问清楚每一家供应商怎么用 AI。 答不上来的团队,等于在浪费你的钱。说「我们让 AI 全写、也不检查」的团队,是风险。你要的是中间那种:用 AI 换速度,用人来审查和负责。
- 按结果付钱,不要按代码行数。 代码既然便宜了,就看这个东西能不能跑得起来、合不合马来西亚的规矩、撑不撑得住你真实客户的使用。
- 把之前搁着的小项目捡回来。 两年前嫌「太贵」的内部工具和系统对接,现在可能已经进得了你的预算。成本的门槛降低了。
想看更完整的检查清单,可以读我们这篇AI 时代怎么挑软件开发公司。
在想 AI 会怎么改变你该建什么、又该花多少钱?聊聊看。我们给你一个老实的判断,不推销。




