上周 r/LocalLLaMA 有一则帖子拿到接近 1,000 个赞,讲的是一件很小众的事:Qwen 3.6 27B 在一台 Mac 上用一种叫 MTP 的技术,跑出每秒 28 个 token。发帖的人说,这终于让本地 agentic coding 变成一个可行的选项。
翻成人话:一个跑在你自己笔记本上的模型,快到足以驱动一个真正的编程助手。像 Claude Code,但离线、按 token 不用钱、上下文窗口 262k。对手上握着客户敏感代码的马来西亚开发团队来说,本地 AI 写代码从这一刻起不再只是玩票。
本地 LLM 真的能接上 Claude Code 吗?
三件事凑在一起。
Qwen 3.6 27B 是阿里巴巴的开源权重 dense 编程模型,278 亿参数,专门为 Cursor 和 Cline 背后那种多步骤调用工具的模式训练。
MTP(Multi-Token Prediction) 让模型一次往前预测好几个 token(Qwen 3.6 用 5 个 head,每次验证 3 个),然后一口气核对。代码是有规律的,所以大部分预测都猜中:接受率 83%,速度快 2.5 倍,测不出质量损失。
接口直接兼容。 这些版本同时开放 OpenAI 和 Anthropic 兼容的接口。设一句 ANTHROPIC_BASE_URL=http://127.0.0.1:8081,Claude Code 就走你本地的模型。
速度这道坎刚被撞破
本地 agentic coding 的速度这道坎,刚刚被撞破。图:Gotchaa Lab
本地编程模型一直卡在每秒 10 到 15 个 token。Agentic coding 特别折磨人:AI 一个任务要调用 20 到 30 次工具,每次都得等一整段回应。跑 12 tok/s 的话,修一个 bug 就是盯着转圈图标好几分钟。
28 tok/s 是体验开始像 Cursor 的那条线。还是比不上云端,但已经不烦人了。262k 的上下文窗口同样关键。48GB 统一内存配 Q5_K_M 量化,Qwen 3.6 27B 大概装得下 20 万行代码。一个真实的 Laravel monolith,不是 demo。
老实说说不足
本地 AI 写代码现在能用了,但它还不是 Claude Opus 4.7。
跑分上,Qwen 3.6 27B 比大家想的更靠近前沿:SWE-bench Verified 77.2%(Claude Opus 4.6 是 80.8%),Terminal-Bench 2.0 拿 59.3%,和 Claude 4.5 Opus 打平。写样板代码、重构、测试、CRUD,你感觉不到差距。
差距出现在需要判断的活上:不熟的代码库、棘手的并发、难下的架构决定。这些前沿的 Claude 还是赢。那位 Reddit 用户也讲得很直接:真正划算的那一档是 Q8_0,而流传很广的那句“6-bit 几乎等于 8-bit”,按对方自己的测试并不成立。
这件事对马来西亚团队的意义
两个理由,都对得上真实的客户对话。
PDPA 和客户的机密代码。 银行、GLC 和医疗客户越来越常把“不准把代码交出去”写进供应商合约。把源码送去 OpenAI 或 Anthropic,在 PDPA 2024 修订下算跨境数据传输。以前你的选择是:用能力更弱的本地模型、自己架 GPU 机器,或者干脆推掉这单。现在一台 96GB 统一内存的 Mac Studio 大约 RM20,000 到 RM25,000。团队里有两三个人在做敏感项目的公司,这笔钱很快就赚回来。
API 的成本账变了。 Anthropic 最近把 Claude Code 的花费估算翻了一倍,来到每个开发者每天大约 USD 13,用得凶的超过 USD 20。一个五人的吉隆坡团队,一个月大概 RM13,000 到 RM20,000。一台 RM20,000 到 RM25,000 的 Mac Studio 一到两个月回本,而且没有速率限制。
策略还是我们那篇 AI 竞赛的文章里讲的两层做法:量大的活交给本地,值得为数据出境做取舍的判断题交给前沿模型。
本地 AI 写代码,好到可以取代 Claude Code 吗?
对大部分团队来说,还不行。这套配置要你习惯命令行、会编译 llama.cpp、忍得住各种小毛病。维护者放出的那四个 chat template 修正是必须的,不然 C++ runtime 里的工具调用跑不起来。如果你心目中的“AI 编程配置”是装一个 VSCode 插件,这套暂时不适合你。
12 个月内,这一整套大概会变成 LM Studio 或 Ollama 里一键安装的东西。现在务实的做法是:Claude Code 该付照付,但把 AI 的开销记下来,同时想清楚哪些客户真的在乎数据不出境。等下一代 Qwen 出来,早就准备好本地优先交付的团队会先动。
我们的看法
Qwen 3.6 27B 这类工具,让写软件里机械的那部分变得更快更便宜。它们处理不了的是判断:哪一套架构撑得过三年、怎么接上现有的 LHDN 系统、PDPA 的风险敞口到底有多大、凌晨两点出事时谁负责。
机械的那部分正在变成谁都买得到的东西。判断不是。
在 PDPA 的限制下考虑怎么用 AI 写代码,或者想做一套本地优先的定制软件?找我们聊聊,不推销。




