Gotchaa Lab
返回博客
AIdeveloper-toolslocal-aimalaysiaagentic-coding

为什么有些吉隆坡团队宁可买 Mac Studio,也不再续 Claude 订阅

2026年5月9日·阅读约 5 分钟·作者:Gotchaa Lab
为什么有些吉隆坡团队宁可买 Mac Studio,也不再续 Claude 订阅

黄昏时分,吉隆坡一间工作室桌上的 Mac Studio:本地算力是买回来的,不是租来的。

重点摘要

  • Qwen 3.6 27B 配上 MTP 推测解码,在 96GB RAM 的 Mac 上跑到每秒 28 个 token,够快,本地 agentic coding 真的能用了。
  • 262k 的上下文窗口塞得下一个真实的代码库,而且它开放 OpenAI 和 Anthropic 兼容的接口,Claude Code、Cursor、Cline 直接接上去就能用。
  • 跑分离前沿模型不远(SWE-bench Verified 77.2%,Opus 4.6 是 80.8%;Terminal-Bench 2.0 和 Claude 4.5 Opus 打平)。差距要在难的架构工作上才看得出来。
  • 做 PDPA 敏感的项目,一台 Mac Studio(大约 RM20,000 到 RM25,000)对比每月的 Claude Code API 开销,大概一到两个月回本。Anthropic 现在估算每个开发者每天要花 USD 13。

上周 r/LocalLLaMA 有一则帖子拿到接近 1,000 个赞,讲的是一件很小众的事:Qwen 3.6 27B 在一台 Mac 上用一种叫 MTP 的技术,跑出每秒 28 个 token。发帖的人说,这终于让本地 agentic coding 变成一个可行的选项。

翻成人话:一个跑在你自己笔记本上的模型,快到足以驱动一个真正的编程助手。像 Claude Code,但离线、按 token 不用钱、上下文窗口 262k。对手上握着客户敏感代码的马来西亚开发团队来说,本地 AI 写代码从这一刻起不再只是玩票。

本地 LLM 真的能接上 Claude Code 吗?

三件事凑在一起。

Qwen 3.6 27B 是阿里巴巴的开源权重 dense 编程模型,278 亿参数,专门为 Cursor 和 Cline 背后那种多步骤调用工具的模式训练。

MTP(Multi-Token Prediction) 让模型一次往前预测好几个 token(Qwen 3.6 用 5 个 head,每次验证 3 个),然后一口气核对。代码是有规律的,所以大部分预测都猜中:接受率 83%,速度快 2.5 倍,测不出质量损失。

接口直接兼容。 这些版本同时开放 OpenAI 和 Anthropic 兼容的接口。设一句 ANTHROPIC_BASE_URL=http://127.0.0.1:8081,Claude Code 就走你本地的模型。

速度这道坎刚被撞破

一枚细长的金属弹体撞穿磨砂玻璃,裂纹从发光的撞击点向外扩散 本地 agentic coding 的速度这道坎,刚刚被撞破。图:Gotchaa Lab

本地编程模型一直卡在每秒 10 到 15 个 token。Agentic coding 特别折磨人:AI 一个任务要调用 20 到 30 次工具,每次都得等一整段回应。跑 12 tok/s 的话,修一个 bug 就是盯着转圈图标好几分钟。

28 tok/s 是体验开始像 Cursor 的那条线。还是比不上云端,但已经不烦人了。262k 的上下文窗口同样关键。48GB 统一内存配 Q5_K_M 量化,Qwen 3.6 27B 大概装得下 20 万行代码。一个真实的 Laravel monolith,不是 demo。

老实说说不足

本地 AI 写代码现在能用了,但它还不是 Claude Opus 4.7。

跑分上,Qwen 3.6 27B 比大家想的更靠近前沿:SWE-bench Verified 77.2%(Claude Opus 4.6 是 80.8%),Terminal-Bench 2.0 拿 59.3%,和 Claude 4.5 Opus 打平。写样板代码、重构、测试、CRUD,你感觉不到差距。

差距出现在需要判断的活上:不熟的代码库、棘手的并发、难下的架构决定。这些前沿的 Claude 还是赢。那位 Reddit 用户也讲得很直接:真正划算的那一档是 Q8_0,而流传很广的那句“6-bit 几乎等于 8-bit”,按对方自己的测试并不成立。

这件事对马来西亚团队的意义

两个理由,都对得上真实的客户对话。

PDPA 和客户的机密代码。 银行、GLC 和医疗客户越来越常把“不准把代码交出去”写进供应商合约。把源码送去 OpenAI 或 Anthropic,在 PDPA 2024 修订下算跨境数据传输。以前你的选择是:用能力更弱的本地模型、自己架 GPU 机器,或者干脆推掉这单。现在一台 96GB 统一内存的 Mac Studio 大约 RM20,000 到 RM25,000。团队里有两三个人在做敏感项目的公司,这笔钱很快就赚回来。

API 的成本账变了。 Anthropic 最近把 Claude Code 的花费估算翻了一倍,来到每个开发者每天大约 USD 13,用得凶的超过 USD 20。一个五人的吉隆坡团队,一个月大概 RM13,000 到 RM20,000。一台 RM20,000 到 RM25,000 的 Mac Studio 一到两个月回本,而且没有速率限制。

策略还是我们那篇 AI 竞赛的文章里讲的两层做法:量大的活交给本地,值得为数据出境做取舍的判断题交给前沿模型。

本地 AI 写代码,好到可以取代 Claude Code 吗?

对大部分团队来说,还不行。这套配置要你习惯命令行、会编译 llama.cpp、忍得住各种小毛病。维护者放出的那四个 chat template 修正是必须的,不然 C++ runtime 里的工具调用跑不起来。如果你心目中的“AI 编程配置”是装一个 VSCode 插件,这套暂时不适合你。

12 个月内,这一整套大概会变成 LM Studio 或 Ollama 里一键安装的东西。现在务实的做法是:Claude Code 该付照付,但把 AI 的开销记下来,同时想清楚哪些客户真的在乎数据不出境。等下一代 Qwen 出来,早就准备好本地优先交付的团队会先动。

我们的看法

Qwen 3.6 27B 这类工具,让写软件里机械的那部分变得更快更便宜。它们处理不了的是判断:哪一套架构撑得过三年、怎么接上现有的 LHDN 系统、PDPA 的风险敞口到底有多大、凌晨两点出事时谁负责。

机械的那部分正在变成谁都买得到的东西。判断不是。

在 PDPA 的限制下考虑怎么用 AI 写代码,或者想做一套本地优先的定制软件找我们聊聊,不推销。

参考资料

  1. 2.5x faster inference with Qwen 3.6 27B using MTP, r/LocalLLaMA
  2. Qwen3.6-27B-MTP-GGUF model card on Hugging Face
  3. Qwen 3.6 27B official release post
  4. Claude Code Pricing in 2026, SSDNodes analysis
  5. llama.cpp PR #22673, MTP speculative decoding support

分享这篇文章

常见问题

Qwen 3.6 27B 是什么?
Qwen 3.6 27B 是阿里巴巴的开源权重编程模型,278 亿参数,上下文窗口 262k token。它专门为 agentic coding 训练,也就是 Cursor 和 Claude Code 背后那种来回调用工具的模式。模型够小,一台 48GB 统一内存的 Mac 就跑得动。
本地 LLM 真的能接上 Claude Code 吗?
可以。Qwen 3.6 27B 的 GGUF 版本会开放一个 Anthropic 兼容的 API 接口。把 ANTHROPIC_BASE_URL 指向本机(例如 http://127.0.0.1:8081),Claude Code CLI 就会走你本地的模型。OpenAI 那一类工具同理,指向 OpenAI 兼容的接口就行。
本地 AI 写代码,好到可以取代 Claude Code 吗?
跑分上比大家想的接近:Qwen 3.6 27B 在 SWE-bench Verified 拿 77.2%,Claude Opus 4.6 是 80.8%,Terminal-Bench 2.0 上和 Claude 4.5 Opus 打平。写样板代码、重构、生成测试、做 CRUD,你感觉不到差距。碰到难的架构决定、棘手的并发 bug、不熟的代码库,前沿的 Claude Opus 4.7 还是赢。
跑 Qwen 3.6 27B 需要什么配置?
Apple Silicon 这边,32GB 统一内存的 Mac 能跑 Q5_K_M 量化、80k 上下文,48GB 才解锁完整的 262k。NVIDIA 这边,单张 24GB 卡(RTX 4090)在 Q4_K_M 下能跑 83k 上下文,48GB(RTX 6000 Ada 或两张卡)才够完整的 262k 窗口。那位 Reddit 用户跑出 28 tok/s 用的是 M2 Max 96GB,对多数人来说是超配。
本地 AI 写代码,PDPA 上比云端 API 更稳妥吗?
在跨境传输这一点上是的。把源码、NRIC 或交易数据送去 OpenAI 或 Anthropic,在马来西亚 PDPA 2024 修订下算跨境传输。自建的本地模型把东西留在自己办公室,面对银行、医疗和政府项目时,合规的说法简单很多。但该有的权限控制、审计日志和外泄应对计划,还是一样要有。

想为你的公司做一套这样的系统?

我们帮马来西亚企业把这类想法做成能用的软件。免费咨询,不勉强。