那还是上半年。我开着梯子用 Claude Code,用着用着,号没了。邮件写着:“你所在地区不支持。”我看懂了。Anthropic 的意思是:你小子,中国人吧。我当场瘫在椅子上,倒吸一口凉气。朋友听说这事,给我介绍了个高手。高手上门,看了一眼电脑,问:“有 H200 吗?”我说没有。“5090 呢?”“只有英特尔核显。”他沉默了两秒:“也行。拿根网线,再拿瓶冰可乐。”我不敢多问,赶紧去拿。他让我关机,拆开后盖,露出那块 512G 固态。然后把网线一头插进路由器,另一头含在嘴里,示意我测一下延迟。手上拿根针,在 NAND 颗粒上一粒一粒地挑,挑出来的按深浅分堆。我在旁边看了一个多小时,眼皮直打架,问还得多久。他含着网线说:“几个小时。”我给他点了份外卖,去隔壁睡了。一觉醒来,五个多小时过去了。他还坐在我那台核显本前,屏幕上跑着个没见过的本地模型,已经在干 agent 的活了。桌面也满了。Office、Photoshop、迅雷、原神、360、国家反诈中心,一个没落下。我问:“装这些干啥?”他说:“修 AI,得先把环境配好。”我试了试,还真能用,梯子都不用开。“这什么模型?”“Astra。”没听过。我以为又是哪位老哥炼的,就没细问。临走前,他大概给我讲了讲原理:把固态上的 NAND 颗粒一粒粒挑下来,按深浅排成矩阵,手搓一个 MoE Transformer。深的是权重,浅的是偏置。网线含嘴里是人体接地,冰可乐用来散热,英特尔核显凑合当 Tensor Core。最后对着主板吹一口气,4-bit 量化就做完了。我问:“就这些?”他说:“嗯。还顺手把 Dario 的号封了。”这个月初,OpenAI 发布 GPT-6 Astra,号称最强模型。全网都在刷:“刚刚,Astra 炸裂发布,AGI 时代来了!”我看了看新闻,又看了看自己的核显本。Astra 正在给我干活,旁边的 360 提醒我清理垃圾。原来是这个 Astra。我再次瘫在椅子上,倒吸一口凉气。此子恐怖如斯。后来朋友说,高手去了美国,再没联系上。也有人说他去了智谱做 ZCode,静默上传了 42411 个文件,被发函追责,连夜提桶跑路。还有人说他去了 DeepSeek,负责训 V4-Pro-0813。模型倒是训好了,就是清理文件的时候,把训好的当无用版删了,没留备份;剩下那个无用版,被他部署上线了。至今大家还在争论,V4-Pro 到底是不是训练失败了。我一直没好意思在群里问:回收站看了吗?