
全世界刷屏的“牛来大模型”,到底是谁家的“牛”?
Tokenizer、视频编码、API 报错被扒了个底朝天
这两天,AI 圈已经将这款神秘的模型扒了个底朝天。
目前,讨论度最高的候选厂商指向了智谱和谷歌。
支持智谱说的人已经开始验证 Tokenizer、测试视频 Token 消耗、比对 API 报错,试图为该模型做一套“数字 DNA 鉴定”;而倾向谷歌说的人,则主要盯着 Google DeepMind 员工最近的社交媒体发言,以及那款迟迟未正式露面的 Gemini 3.5 Pro。
这款“牛来大模型”的官方名称其实是 Ox Alpha。
因“Ox”意为“牛”,又恰逢近期“牛来”梗火遍中文互联网,国内网友便亲切地称其为“牛来大模型”。
8 月 20 日,它以匿名模型的身份突然上线 OpenRouter。平台方仅透露其来自一家暂时保密的第三方供应商。
该模型拥有 104.86 万 Token 的上下文窗口,单次最大输出达 13.1 万 Token,支持文本、图片和视频等多模态输入,主打代码生成、长周期 Agent 和复杂推理任务。
随后,OpenCode 宣布 Ox Alpha 上线 OpenCode Go,并提供连续数天的“几乎不限量”免费使用福利,且不计入用户原有的 Go 额度。在社区讨论中,甚至传出了其服务容量高达每天 100 万亿 Token 级别的说法。
这吸引了大量开发者携带复杂代码库和各种刁钻任务一拥而上,对其展开极限测试,并纷纷猜测其真实身份。

为什么猜测指向这两家?
大家之所以猜测 Ox Alpha 属于智谱或谷歌,是因为它在中文深度理解、超长上下文处理以及多模态融合上,展现出了这两家厂商的典型特征,并在底层工程细节上暴露出了相似的技术指纹。
为什么猜测是智谱?
智谱是这场猜谜游戏中的热门候选者。网友们已经从 Ox Alpha 的分词器(Tokenizer)、视频编码方式一路扒到了 API 服务层。
1. Tokenizer 特征一致
Tokenizer 负责将输入内容切分为模型可处理的 Token。不同模型家族通常采用不同的词表和切分逻辑,因此在面对特定文本时,Token 数量会留下独特的“指纹”。
有测试者使用不同的 Prompt 对 Ox Alpha 和多款模型进行对比,结果发现,Ox Alpha 与 GLM-5.3 的 Token 计数呈现出高度一致的关联性。
在一组流传较广的测试中,针对同一段混合了中英文、代码和 Emoji 的文本,GLM-5.3 与 GLM-5.2 均计算出 68 个 Token,而 Ox Alpha 则显示为 143 个。多出来的 75 个 Token,恰好可以通过模型外部附加的一段隐藏 System Prompt 来解释。
另有测试者使用 25 组不同的 Prompt 进行验证,也观察到了类似的固定偏移关系。
2. 多模态指纹高度相似
文本模型或许可以通过蒸馏、后训练或 System Prompt 来模仿其他模型的回答习惯,但视频编码和 Token 预算则涉及多模态输入进入模型前的底层工程设计。
有研究者制作了 4 段受控测试视频,分别输入给 Ox Alpha 和几款主流多模态模型,观察系统为视频分配的输入 Token 数量。
结果显示,Ox Alpha 和 GLM-5V-Turbo 在多项特征上表现出了高度相似的 Token 预算:
- 视频帧率变化后,采样策略基本不受影响;
- 视频时长增加时,Token 消耗约以每秒 147 个的速度增长;
- 每帧分辨率变化对应的 Token 缩放方式高度一致。
在 4 段控制视频中,两者的额外 Token 预算甚至能够逐项对应。而作为对比的 MiMo、Qwen 和 GLM-4.6V 等模型,则呈现出截然不同的特征。
3. API 服务层的蛛丝马迹
社区中有人故意向 Ox Alpha 传入异常参数,捕获到了类似于 [1210] The temperature parameter is illegal 的错误信息。这种错误码格式、参数限制以及中英文混排的返回方式,被认为与智谱的相关服务高度相似。
甚至有用户声称,在模型的推理输出中捕获到了“trained by Z.ai”等残留信息。不过该条线索目前主要来自社区截图和二手转述,证据链完整度低于 Tokenizer 和视频 Token 测试。

此外,还有一个背景让“智谱说”显得更加合理:
今年 2 月,OpenRouter 曾上线过另一款匿名模型 Pony Alpha。在经历了一轮猜测后,OpenRouter 最终揭晓答案——Pony Alpha 正是 GLM-5 的早期测试版本。
因此,看到 Ox Alpha 之后,不少人的第一反应便是:智谱,你又带新模型来测试了?
谷歌成为“认领”热门人选
尽管智谱的线索看似充足,但这两天舆论风向又开始偏向谷歌。
从产品画像来看,Ox Alpha 确实容易让人联想到 Gemini:1M 级别的超长上下文、原生图像和视频输入支持、面向长期 Agent 任务、强调复杂代码工程和工具调用。这些正是谷歌过去几代 Gemini 模型持续重点投入的方向。
而谷歌目前恰好有一款迟迟未正式亮相的 Gemini Pro。在今年 Google I/O 期间,谷歌曾给出 Gemini 3.5 Pro 将于“下月发布”的预期,但随后发布时间一再推迟。关于其发布节奏、内部测试和产品调整,行业内也出现过多轮爆料。

同时,Google 和 DeepMind 员工这两天在社交媒体上的动态,也给网友留下了想象空间。
例如,Google DeepMind 研究员 Evan Otero 在相关讨论中提及了“Gemini”,随后又写道:“如果 Ox Alpha 就是我们一路走来遇到的朋友呢?”

虽然这些发言并未明确承认“Ox Alpha 就是 Gemini”,但在全网热议的背景下,很快被社区解读为一种暗示。
在 Techmeme 汇总的社媒讨论中,不少开发者注意到,近期 Gemini 团队成员突然密集讨论 Gemini 及下一代模型,也有人因此将 Ox Alpha 与 Gemini 3.5 Pro 甚至 Gemini 4 联系在了一起。
目前,网上主要分为两派观点:
- 一派拿着 Tokenizer 和视频 Token 账单认定“这明明就是 GLM”;
- 另一派则指着 DeepMind 员工的帖子认为“谷歌在故弄玄虚”。
目前尚无决定性的公开证据能证实上述任一说法。这也表明,仅凭模型外部行为来判断其开发者身份正变得越来越困难。尤其是在蒸馏、模型融合、后训练以及第三方推理服务日益普遍的当下,“模型由谁训练”与“模型部署在何处”甚至可能是两个不同的问题。
免费的 Ox Alpha,吸引了全球开发者
抛开身份谜题,Ox Alpha 本身的能力也颇具看点。
首先在规格上,1M 上下文意味着单次 Prompt 理论上可以容纳整个大型代码库、数百页文档或长期的 Agent 运行记录。131K 的最大输出也远超普通对话场景。配合图像与视频输入、工具调用及强制推理模式,Ox Alpha 显然是为代码 Agent 和长周期任务量身定制的。
根据 OpenCode 的公开数据,Ox Alpha 已经累计处理