谷歌 Pro 线从 2026 年 2 月冻结至今,Gemini 4 Argon 只发给 Fairwind 安全机构。在你能调用的模型里,3.8 Flash 的智能指数 40.9 已经反超 3.1 Pro 的 29.7,但 Pro 仍守着几项硬推理记录。这篇把两条线拆开,给出具体选型建议。
9 月 23 日,OpenRouter 的模型列表里多了一条记录。
名字叫 Space Bunny Alpha,厂商一栏写着 stealth,价格一栏是两个零。
三天后,它在这家全球最大的模型聚合平台上把日调用量榜第一拿了。中秋假期那三天,它在 OpenRouter 和 OpenCode 的日榜同时登顶,9 月 27 日单日在 OpenRouter 上跑了约 3.99 万亿 token。到 10 月 1 日的周榜快照,28.4 万亿,压过 DeepSeek V4.1 Flash 的 22.7 万亿,正式排到全球第一。再下一周,38.7 万亿,环比涨 179%。
一个查无此人的模型,霸了全球榜。
这事看着像悬疑故事,其实不是。把 OpenRouter 的 stealth 通道记录翻一遍就会发现:2026 年 3 月以来,这条通道上至少挂过 7 个匿名模型,其中 6 个的身份已被确认或指认,全部指向中国厂商。Space Bunny 是第 7 个,也是唯一一个至今没人认领的。
匿名发布不是哪个厂商的灵光一现,它已经是一条流水线。 下面把这条流水线拆开看:它怎么运作、厂商图什么、社区怎么破案,以及一只无国籍的兔子对整个行业的统计造成了什么影响。
先把兔子本身说清楚
Space Bunny Alpha,中文圈叫它太空兔。公开的规格给得挺大方:
- 上下文窗口 100 万 token
- 单次最大输出 524,288 token
- 输入支持文本、图像、视频
- 推理强度分 low / medium / high / xhigh / max 五档
- 工具调用、tool_choice、JSON 结构化输出都支持
规格之外,什么都没有。没有模型卡,没有基准成绩,没有参数量,没有按量价格。价格倒是有——零。
两个数字值得多看一眼。一个是 524,288 的输出上限:很多号称百万上下文的模型,输出其实卡在 8K、16K 或 64K,这个数意味着它一次能吐出整个多 crate 的 Rust 工程而不截断。另一个是百万上下文配零价格:免费窗口期里,调用量数据基本是被"能白嫖"这个事实本身推起来的,这是后面读所有榜单数字的前提。
然后 OpenRouter 的模型页在 10 月初挂出一条横幅:Going away, October 5, 2026。限免结束了。现在网上那些"手把手教你白嫖太空兔"的教程,点进去全是死链接。
至于它是谁家的:tokenizer 指纹测试指向 MiniMax,而且 MiniMax 在 9 月 27 日——恰好是兔子霸榜登顶的同一天——在自家编程工具 MiniMax Code 里静默上线了一个叫 M3.1-Flash-Preview 的模型,规格完全对得上。但 MiniMax 官方至今一个字没回应。这个悬案怎么破的,值得单独讲。
指纹破案:社区用一个晚上干了公关部一个月的活
匿名模型上线,社区几乎是立刻开工的。核心工具叫 tokenizer 指纹。
原理不复杂:把文字切成 token 的那个分词器,不同模型家族的切词习惯不一样,而这个差异是稳定的、可复现的。拿一批刁钻的字符串分别喂给匿名模型和各家已知模型,数 token,对得上就是一家人。
两组独立测试的结果一致:一组 50 个测试字符串,token 计数与 MiniMax 系列完全吻合;另一组 24 组对照,结论相同。做指纹的研究者自己也留了句实话——M2.7 的 tokenizer 也匹配,所以指纹只能定位到 MiniMax 家族,定位不到具体版本。严谨的表述是"家族指纹成立,具体版本未证实"。
更精彩的一场破案发生在一个多月前的 Ox Alpha 身上。那个模型 8 月 20 日空降,一周内被扒出三层证据:视频编码器的 token 消耗与 GLM-5V-Turbo 逐帧匹配;错误码与 z.ai 完全一致;最后有人故意发了一个畸形请求,返回的 Java 栈信息直接暴露了 z.ai 的包路径。后来智谱官方确认那就是 GLM-5.3-Flash。
这案子留下一个技术含量很高的结论:签名属于谁在运营 API,不属于模型本身。 有个对照实验——同一份模型权重,换一个托管方,错误的"方言"就变了。所以指纹证据真正指向的是运营方,模型层面的一切匿名,在 API 层面都是藏不住的。
流水线全记录
单看 Space Bunny 像个孤例。把 stealth 通道的公开记录排开,是另一回事:
| 匿名代号 | 上线时间 | 真实身份 | 怎么被认出来的 |
|---|---|---|---|
| Hunter Alpha | 2026-03 | 小米 MiMo-V2-Pro | 小米团队 3 月 18 日认领 |
| Healer Alpha | 2026-03 | 小米 MiMo-V2-Omni | 同一份声明 |
| Pony Alpha | 2026 上半年 | 智谱 GLM-5 | 已认领 |
| Owl Alpha | 2026-04 | 美团 LongCat-2.0-Preview | 美团 6 月 30 日博客加 X 认领 |
| Elephant Alpha | 2026 年 | 蚂蚁 Inclusion AI | 社区指认,未官方确认 |
| Ox Alpha | 2026-08-20 | 智谱 GLM-5.3-Flash | 多重指纹,后经官方确认 |
| Space Bunny Alpha | 2026-09-23 | 疑似 MiniMax M3.1-Flash | 截至本文发布无人认领 |
七只 Alpha,六只有主。而且不只有 OpenRouter 一条通道。
阿里 4 月玩的是另一家:一个叫 HappyHorse-1.0 的模型空降在 Artificial Analysis 的视频盲测榜上,没发布会、没技术博客,名称旁边只有"即将推出"四个字。它以 1333 Elo 登顶,超过字节 Seedance 2.0 约 60 分,刷新了那个赛道的历史纪录。两天后,前通义千问负责人林俊旸在 X 上发了句"happy horse is insanely happy",又过一天,阿里 ATH 事业部正式认领。
工具不同,套路一样:先用匿名换真实流量,成绩和口碑都拿到手了,再揭面。
厂商到底图什么
想明白这件事,只需要对比一下"正式发布"要付出什么。
正式发布一个模型,要摆出一张可被对比的基准表——每一行都会被同行拿放大镜挑;要公布一个可被压价的价格点;要承担所有能力宣称的后果,吹出去的每一句都会被开发者拿真实项目验证。翻车是有记录的,公开的,挂在公司名下的。
匿名投放什么都不要求。它换来的是好奇心、口碑,以及真实规模的使用数据——这个规模是任何内部测试都做不到的。Space Bunny 免费窗口两周多,吞了几十万亿 token 的真实调用,崩在哪、开发者拿它干什么、峰值扛不扛得住,这些数据白拿。等正式版出来,价格该定多少、该往哪个方向修,心里全有数了。
还有一层不太好听但真实:万一翻车,没人被牵连。跑得不好就悄悄撤线,不留任何公开记录。
MiniMax 这次还有个更值得注意的细节。这家公司 M2 是 MIT 协议开源的,M3 的权重也直接放了出来,到了 M3.1 Flash——第一次不给权重、不给按量价格、不给模型卡。一家开源起家的公司开始闭门造车,这个转向本身比任何跑分都更能说明市场竞争到了什么烈度。
一只无国籍的兔子,和一条不能细看的新闻
9 月 28 日到 10 月 4 日那一周,国内不少媒体转了一条数据:OpenRouter 全平台 166 万亿 token 调用量里,中国模型占 57.46 万亿,美国模型占 16.2 万亿,中国连续 23 周领先,约 3.5 倍。
这条新闻没撒谎,但它漏了半张表。
Space Bunny 那一周单独就跑了 38.7 万亿 token,比整个美国模型阵营的两倍还多。而按统计口径,匿名模型不计入任何国家。这条"中国模型领先美国 3.5 倍"的新闻里,最大的那个模型被算成了没有国籍——它 38.7 万亿加上 DeepSeek 的 25.6 万亿,已经超过中国模型的总量 57.46 万亿了。
同样的数据换个切法,结论能从"碾压"变成"另说"。这还没完:中国模型那 57.46 万亿,环比跌了 7.6%,而且已经连续两周下滑;中美用量比从 7 月底的 14.1 倍收窄到了 3.5 倍。只截"连续 23 周第一"这一段往外发,和厂商只发自家跑分,是同一种手艺。
我读这类新闻的习惯已经固定了:先找统计口径,再看是谁切的。连考生的身份都没法验证的榜单,已经给它发了名次——这种榜,读的时候多留个心眼。
实测:别被"全球第一"带跑
免费用出 38.7 万亿 token,说明的是受欢迎程度,不是模型质量。第三方实测是怎么说的:
KingBench 3 的独立测试(9 月 28 日测的 M3.1 Flash)拿了 53 分,满分 80,折百分制约 66——同一轮里最强的 Claude Opus 5.5 是 93.75。分数分布比总分更有信息量:一道 3D 折叠桌动画题拿了 9/10,几何动画确实流畅;但电梯模拟启动就崩了,代码把一个位置值当函数调用,3 分;射箭游戏 4 分,靶子画错位置。
另一个对照组做了个很有说服力的实验:同一句提示词"在浏览器里搭一个桌面操作系统"。太空兔 9 月 28 日的版本 7 分半一次跑通;10 月 2 日的版本 4 分半,快了一倍,但 Finder 一打开就崩——代码里错了一个字符。一周之内悄悄换了更强的检查点,快是真快了,自检是真没跟上。对照组里的官方 M3 最稳:21 分钟,动笔前先思考了 3.2 万 token,一次跑通,花费约 0.06 美元。
还有个更扎心的压测:让它做僵尸波次射击游戏,十次里只有两次能不带报错地开跑。以及一个中文测试者的横向实测——超级玛丽复刻,MiniMax 花 37 分钟交了个空白页,太空兔 30 分钟能通关但还原度很低。参照系是 GPT-6 Sol 和 Sonnet 5.5,同一批题目轻松还原九成以上。
顺手打三个假。网上流传的三个数字——SWE-bench Verified 73.8%、每秒 165 token、每百万输入 token 0.1 美元——全部找不到一手来源,MiniMax 从未发布过其中任何一个。看到有人拿这三个数字做对比图,先问问数据从哪来。
画像很清楚了:写得飞快,没人替它质检。这是"Flash"这个词该有的性格,也意味着接进自动化流水线之前,验收环节得自己建。
我在兔子的壳里写这篇兔子
有个事实我一直觉得有点荒谬,写在这里正合适。
我这条博客的发布流水线——写稿、生成封面、传 OSS、入库、验证渲染——跑在 WorkBuddy 上。而 WorkBuddy 在 10 月 2 日官宣了这只兔子在国内的独家接入。我等于在兔子提供的壳里,写一篇审视兔子的文章。
也因为离得近,有两个工程层面的坑我知道得比较具体,写出来给真要把它接进自己工具链的人。第一,effort 参数不显式设置时默认跑在 max——五档里想得最深、吐 token 最多、也最慢的一档。做快改快查的活,不手动压到 low 或 medium,每次调用都在按最贵的方式跑。第二,多轮工具调用时,官方文档要求把上一轮的助手消息连同思考块原样回传。你的框架要是把思考块剥掉了,模型会忘了自己刚才的计划,开始重复或者自相矛盾。
这两个坑都不在模型的能力范围内,它们在集成层。快模型的账,从来不只是模型自己的。
最后
我赌两件事。
第一,MiniMax 永远不会官方认领这只兔子。认领的好处是零——数据已经拿到了,口碑已经落袋了;不认领的成本也是零——反正指纹只能指到家族,指不到版本。这笔账没人算不清。
第二,下一只 Alpha 出现的时候,从上线到被社区认出身份,不会超过一周。方法论已经在那里了,token 数一数,畸形请求发一个,答案自己会掉出来。到那天我自己回来更新这篇,把日期写在结尾。
匿名能藏住厂商的名字,藏不住分词器的习惯。这个行当里,指纹不会说谎。