经过近两年的沉寂后,万智牌带着研究更新回来了。由两名维也纳工程师 Eric Steinberger 和 Sebastian De Ro 创立的一家人工智能初创公司发表了一篇博文,直接解决了业界最紧迫的问题之一:从头开始训练有竞争力的语言模型需要多少计算量?
魔术师的回答让人安心。该公司表示,其预训练配方现在比领先体重模型背后的配方有效十倍以上。推理很直白,团队用自己的话说:
“也就是说,前沿预训练对实验室来说是一场大游戏。我们还没有 100k 芯片,所以只有一种方法:算法效率。我们的新配方与 DeepSeek V4 Pro 的预训练相匹配,计算量减少了 50 倍 – 这大约是 GPT5 所使用的 FLOP 的一半,即约 0.0 GB 美元。”
多么神奇的主张
这 500,000 美元适用于 Nvidia GB200 系统上的计算。第二步,Magic 表示,它将配方增加了十倍,达到近 400 万美元,以惊人的估值击败了所有可用的基本型号。根据 DeepSeek V4 Pro 手册,该公司表示,根据其缩放法则,训练一个具有可比能力的模型将花费超过 1 亿美元。
尺寸并非取自普通标准套房。 Magic 报告存储的数据,而不是每字节丢失的位数。原因是技术性的:基本模型尚未经过强化学习或微调,这使得它们对提示敏感,并使基于选择的提示不可靠。托管的集合包括 Magic 自己的代码库、其他初创公司的专有代码存储库、最近引用的研究论文以及专有的数学问题。
一组对比
显示了竞争对手的选择。 Magic 与中国和美国的开放重量级产品进行了比较:DeepSeek V4 Pro 和 V4 Flash、Moonshot Kimi K2 和 Nvidia Nemotron 3 Ultra。 Anthropic、Google 和 OpenAI 的基本模型不可用,原因很简单。作为代理,Magic 指出 Kimi K3 和 Meta 的 Muse Spark,据称其性能比 Kimi K2 提高了 2.5 倍和 3.3 倍。
为了支持这些数字,该团队表示,它重新计算了多个推理引擎中的基础数字,并引入了推理提供商 Fireworks 进行独立测试。片面的发现:Nvidia 的 Nemotoron 3 在准备阶段全面优于 DeepSeek V4 Pro,这表明该模型的较弱结果可能是由于后测试而不是基线造成的。
根据博文中的图表,在数学题的短期训练中,目前的Magic模型达到了72%的通过率。作为背景,该公司将 GPT-6 Astra 列为 100%,Claude Fable 5.1 为 98%,Kimi K3 为 75%,同时指出这些模型可能会遇到更大的 RL 计算订单。
有一点需要注意:每个模型都来自该公司,没有一个经过独立验证,而且 Magic 还没有发货该模型。博客文章以团队正在等待“发布该项目”这句话结束。
初创公司背后的人
Magic 由 Eric Steinberger 和 Sebastian De Ro 创立,他们是在维也纳 HTL Spengergasse 的一个天才学生项目中相识的。正如热门话题详细报道的那样,两人在自己组装的学校电脑上度过了暑假学习。斯坦伯格 19 岁时在维也纳工业大学从事研究,后来在剑桥三一学院、麻省理工学院和 Facebook AI 工作。 De Ro 曾在 Automic Software 和奥地利联邦铁路 ÖBB 担任开发人员,后来在奥地利初创公司 Firestart 担任首席技术官。该公司的总部现位于美国。
资金很慷慨。该公司完成了 2300 万美元的融资,其中 1.17 亿美元来自 Alphabet,最终获得了 3.2 亿美元的融资,由前谷歌首席执行官 Eric Schmidt、Jane Street、红杉资本、Atlassian 和 CapitalG 以及投资者 Nat Friedman、Daniel Gross 和 Elad Gil 提供支持。该公司价值约15亿美元。 Magic还宣布与谷歌云合作,利用数万个GB200芯片构建计算能力。
从 Windows 上下文到预训练
让万智牌出名的还有另一个说法。通过 LTM-2-mini,该初创公司提出了一个具有 1 亿个代币上下文窗口的模型,相当于约 1000 万行代码或约 750 部小说。当时,该公司称其处理能力是 Google Gemini 处理能力的 50 倍,是 OpenAI 的 GPT-4o 处理能力的 780 倍。
这个序列正是万智牌现在描述其策略的方式。该公司写道,之前的训练、强化学习机构和长期背景结合在一起足以构建非凡的编码代理和自动化人工智能研究。它从一个长的背景开始,然后是初步训练。
接下来会发生什么?
该团队将长期强化学习作为下一个重点,智能体在部署后继续学习,同时研究协调技术。正在准备更新的“AGI 准备政策”,涵盖 RL 训练期间的部署门和安全要求。
博客文章兼作招聘步骤。据说 Magic 可能是世界上训练万亿参数模型的最小团队。