阿里开源国产版o1,实现AI推理新突破

发布时间2024年12月4日

OpenAI 最近推出了具有卓越推理能力的开创性 o1 模型,该模型在 AIMECodeForces 等平台上表现出色,超越了其他领先模型。近日,阿里巴巴MarcoPolo研究团队发布并开源Marco-o1 推理模型,旨在进一步拓展大型语言模型 (LLM) 的边界,增强其推理能力,以应对复杂的现实世界挑战。

AI 领域正在快速发展,尤其是在深度推理能力的领域。然而在针对现实世界问题的时候仍然存在问题:这些任务很难评估,因为没有普遍接受的“正确”答案或易于量化的奖励。

我们能否训练一个模型,让它能应对这种模糊性,并且仍然生成可靠的推理结果?

阿里巴巴MarcoPolo研究团队发布并开源了 Marco-o1 推理模型,它建立在 OpenAI 的 o1 模型的经验教训之上。Marco-o1 不仅关注具有标准答案的学科,例如数学、物理和编码——这些学科非常适合强化学习 (RL),而且还更加强调开放式解决方案,遇到复杂问题时,它能像人类一样层层推理深入思考

论文链接:https://www.aminer.cn/pub/673ffd48ae8580e7ff291d36?fr=Marco-o1

关于作者

项目由阿里人工智能计划负责人张凯夫带领的团队完成。

张凯夫本科毕业于清华大学计算机科学,在欧洲工商管理学院取得管理学博士学位。2018年-2022年阿里淘宝市场运营负责人,2021年至今任职阿里全球电子商务副总裁阿里人工智能计划负责人

来源:https://www.aminer.cn/profile/53f46845dabfaedd74e71378?fr=zkf

Marco-o1如何实现新突破?

简单来说:

Marco-o1 大型语言模型 (LLM) 由思维链 (CoT) 微调、蒙特卡洛树搜索 (MCTS)、反射机制创新推理策略提供支持,针对复杂的现实世界问题解决任务进行了优化。


具体来说:


Marco 推理数据集


通过微调 Qwen2-7B-Instruct 与过滤后的 Open-o1 CoT 数据集 、Marco-o1 CoT 数据集和 Marco-o1 指令数据集的组合,Marco-o1 提高了对复杂任务的处理能力。

📚 Open-o1 CoT 数据集(已过滤):研究者通过应用启发式质量过滤流程来改进 Open-O1 项目的 CoT 数据集。这种增强使模型能够有效地采用结构化推理模式。

📚 Marco-o1 CoT 数据集(合成):研究者使用 MCTS 生成了 Marco-o1 CoT 数据集,这有助于制定复杂的推理路径,进一步增强模型的推理能力。

📚 Marco 指令数据集:认识到强大的指令遵循能力在执行复杂任务中的关键作用,研究者整合了一组指令跟踪数据。这种集成可确保模型在广泛的任务中保持能力,保持其总体有效性,同时显著提高其推理能力。


通过 MCTS 扩展解决方案空间


将 LLM 与 MCTS 集成,以增强 Marco-o1 模型的推理能力:

💎 推理状态的节点:在 MCTS 框架中,每个节点都表示问题解决过程的推理状态。

💎 LLM 输出的操作:来自节点的可能操作是 LLM 生成的输出。这些输出代表了推理链中的潜在步骤或小步骤。

💎 推出和奖励计算:在推出阶段,LLM 继续推理过程到最终状态。

💎 指导 MCTS:此奖励分数R用于评估和选择 MCTS 中有前途的路径,有效地引导搜索到更自信和可靠的推理链。


此外,使用以下公式计算置信度分数来获得每种状态的值:


1.置信度分数



2. 奖励分数

推理动作策略


观察表明,使用动作作为 MCTS 搜索的粒度过于粗糙,通常导致模型忽略关键的细微推理路径。为了解决这一问题,研究人员探索了 MCTS 搜索中的不同粒度级别。最初,使用 steps 作为搜索单位,随后将这些 steps 进一步细分为 6432 个标记的小单元,称为“小步骤”,以便更详细地探索推理路径。

在实验中,MCTS 框架内实施了以下策略:

💎 step 作为 Action:我们允许模型生成完整的推理步骤作为 action。

💎 小步骤作为操作:我们使用 3264 个令牌的小步骤作为操作。通过探索此级别的解决方案空间,该模型能够更好地找到可能被较大的操作单元忽略的正确答案。

结果如何?

MGSM-en 数据集中,Marco-o1-CoTQwen2-7B-Instruct 表现优异,如图 4 所示,这是由于使用了英文 CoT 数据进行了微调。然而,在 MGSM-zh 数据集中,Marco-o1-CoT 的表现与 Qwen2-7B-Instruct 相比有所下降。这种下降归因于用于微调的 CoT 数据是英文的,这可能无法有效地迁移到中文数据中。

💡 Marco-o1是第一个将大型推理模型 (LRM) 应用于机器翻译任务的模型,探索多语言和翻译领域的推理时间缩放定律。

此外,在翻译任务中,我们展示了 Marco-o1 在翻译俚语表达方面表现出色,例如将“这个鞋拥有踩屎感”(直译:“这只鞋提供了踩踏便便的感觉”)翻译成“这只鞋有一个舒适的鞋底”,展示了它对口语细微差别的出色把握。