跳转到内容
主站 新闻 控制台

逼<大模型"? Or maybe

· 量子位
国内AI

全世界刷屏的“牛来大模型”,到底是谁家的“牛”?

Tokenizer、视频编码、API 报错被扒了个底朝天

这两天,AI 圈已经将这款神秘的模型扒了个底朝天。

目前,讨论度最高的候选厂商指向了智谱和谷歌。

支持智谱说的人已经开始验证 Tokenizer、测试视频 Token 消耗、比对 API 报错,试图为该模型做一套“数字 DNA 鉴定”;而倾向谷歌说的人,则主要盯着 Google DeepMind 员工最近的社交媒体发言,以及那款迟迟未正式露面的 Gemini 3.5 Pro。

这款“牛来大模型”的官方名称其实是 Ox Alpha

因“Ox”意为“牛”,又恰逢近期“牛来”梗火遍中文互联网,国内网友便亲切地称其为“牛来大模型”。

8 月 20 日,它以匿名模型的身份突然上线 OpenRouter。平台方仅透露其来自一家暂时保密的第三方供应商。

该模型拥有 104.86 万 Token 的上下文窗口,单次最大输出达 13.1 万 Token,支持文本、图片和视频等多模态输入,主打代码生成、长周期 Agent 和复杂推理任务。

随后,OpenCode 宣布 Ox Alpha 上线 OpenCode Go,并提供连续数天的“几乎不限量”免费使用福利,且不计入用户原有的 Go 额度。在社区讨论中,甚至传出了其服务容量高达每天 100 万亿 Token 级别的说法。

这吸引了大量开发者携带复杂代码库和各种刁钻任务一拥而上,对其展开极限测试,并纷纷猜测其真实身份。


为什么猜测指向这两家?

大家之所以猜测 Ox Alpha 属于智谱或谷歌,是因为它在中文深度理解、超长上下文处理以及多模态融合上,展现出了这两家厂商的典型特征,并在底层工程细节上暴露出了相似的技术指纹。

为什么猜测是智谱?

智谱是这场猜谜游戏中的热门候选者。网友们已经从 Ox Alpha 的分词器(Tokenizer)、视频编码方式一路扒到了 API 服务层。

1. Tokenizer 特征一致

Tokenizer 负责将输入内容切分为模型可处理的 Token。不同模型家族通常采用不同的词表和切分逻辑,因此在面对特定文本时,Token 数量会留下独特的“指纹”。

有测试者使用不同的 Prompt 对 Ox Alpha 和多款模型进行对比,结果发现,Ox Alpha 与 GLM-5.3 的 Token 计数呈现出高度一致的关联性。

在一组流传较广的测试中,针对同一段混合了中英文、代码和 Emoji 的文本,GLM-5.3 与 GLM-5.2 均计算出 68 个 Token,而 Ox Alpha 则显示为 143 个。多出来的 75 个 Token,恰好可以通过模型外部附加的一段隐藏 System Prompt 来解释。

另有测试者使用 25 组不同的 Prompt 进行验证,也观察到了类似的固定偏移关系。

2. 多模态指纹高度相似

文本模型或许可以通过蒸馏、后训练或 System Prompt 来模仿其他模型的回答习惯,但视频编码和 Token 预算则涉及多模态输入进入模型前的底层工程设计。

有研究者制作了 4 段受控测试视频,分别输入给 Ox Alpha 和几款主流多模态模型,观察系统为视频分配的输入 Token 数量。

结果显示,Ox Alpha 和 GLM-5V-Turbo 在多项特征上表现出了高度相似的 Token 预算:

  • 视频帧率变化后,采样策略基本不受影响;
  • 视频时长增加时,Token 消耗约以每秒 147 个的速度增长;
  • 每帧分辨率变化对应的 Token 缩放方式高度一致。

在 4 段控制视频中,两者的额外 Token 预算甚至能够逐项对应。而作为对比的 MiMo、Qwen 和 GLM-4.6V 等模型,则呈现出截然不同的特征。

3. API 服务层的蛛丝马迹

社区中有人故意向 Ox Alpha 传入异常参数,捕获到了类似于 [1210] The temperature parameter is illegal 的错误信息。这种错误码格式、参数限制以及中英文混排的返回方式,被认为与智谱的相关服务高度相似。

甚至有用户声称,在模型的推理输出中捕获到了“trained by Z.ai”等残留信息。不过该条线索目前主要来自社区截图和二手转述,证据链完整度低于 Tokenizer 和视频 Token 测试。

此外,还有一个背景让“智谱说”显得更加合理:

今年 2 月,OpenRouter 曾上线过另一款匿名模型 Pony Alpha。在经历了一轮猜测后,OpenRouter 最终揭晓答案——Pony Alpha 正是 GLM-5 的早期测试版本。

因此,看到 Ox Alpha 之后,不少人的第一反应便是:智谱,你又带新模型来测试了?


谷歌成为“认领”热门人选

尽管智谱的线索看似充足,但这两天舆论风向又开始偏向谷歌。

从产品画像来看,Ox Alpha 确实容易让人联想到 Gemini:1M 级别的超长上下文、原生图像和视频输入支持、面向长期 Agent 任务、强调复杂代码工程和工具调用。这些正是谷歌过去几代 Gemini 模型持续重点投入的方向。

而谷歌目前恰好有一款迟迟未正式亮相的 Gemini Pro。在今年 Google I/O 期间,谷歌曾给出 Gemini 3.5 Pro 将于“下月发布”的预期,但随后发布时间一再推迟。关于其发布节奏、内部测试和产品调整,行业内也出现过多轮爆料。

同时,Google 和 DeepMind 员工这两天在社交媒体上的动态,也给网友留下了想象空间。

例如,Google DeepMind 研究员 Evan Otero 在相关讨论中提及了“Gemini”,随后又写道:“如果 Ox Alpha 就是我们一路走来遇到的朋友呢?”

虽然这些发言并未明确承认“Ox Alpha 就是 Gemini”,但在全网热议的背景下,很快被社区解读为一种暗示。

在 Techmeme 汇总的社媒讨论中,不少开发者注意到,近期 Gemini 团队成员突然密集讨论 Gemini 及下一代模型,也有人因此将 Ox Alpha 与 Gemini 3.5 Pro 甚至 Gemini 4 联系在了一起。

目前,网上主要分为两派观点:

  • 一派拿着 Tokenizer 和视频 Token 账单认定“这明明就是 GLM”;
  • 另一派则指着 DeepMind 员工的帖子认为“谷歌在故弄玄虚”。

目前尚无决定性的公开证据能证实上述任一说法。这也表明,仅凭模型外部行为来判断其开发者身份正变得越来越困难。尤其是在蒸馏、模型融合、后训练以及第三方推理服务日益普遍的当下,“模型由谁训练”与“模型部署在何处”甚至可能是两个不同的问题。


免费的 Ox Alpha,吸引了全球开发者

抛开身份谜题,Ox Alpha 本身的能力也颇具看点。

首先在规格上,1M 上下文意味着单次 Prompt 理论上可以容纳整个大型代码库、数百页文档或长期的 Agent 运行记录。131K 的最大输出也远超普通对话场景。配合图像与视频输入、工具调用及强制推理模式,Ox Alpha 显然是为代码 Agent 和长周期任务量身定制的。

根据 OpenCode 的公开数据,Ox Alpha 已经累计处理