10 月 6 日,Mistral 开放了 Mistral Large 4 的公开 API 预览。开发者现在可以通过 Mistral Studio 测试该模型,公司计划于 10 月底发布模型权重。截至 10 月 7 日,用户可以通过 API 评估模型,但尚无法下载其权重。对于需要在快速通过服务测试与自行部署之间作出选择的团队来说,这一状态很重要。
开发者目前可以使用什么
Mistral 更新日志中的条目确认了公开预览,并说明上线后的前两周提供 50% 的限时折扣。模型页面列出了对多模态输入、函数调用、结构化输出、批量处理和智能体工具的支持。开发者可以先在 API 中使用自己的任务测试模型,再决定是否部署。
截至核查时,模型页面显示的价格为:每百万输入 token 0.68 美元、每百万缓存输入 token 0.07 美元、每百万输出 token 2.09 美元。页面同时列出的常规价格是上述价格的两倍;折扣与上线相关,且有时限。制定预算前,建议直接查阅 Mistral 文档中的最新费率。
规格数据存在差异
Mistral 将 Large 4 描述为多模态混合专家(Mixture of Experts,MoE)架构。文档列出的总参数量为 1.05 万亿、激活参数为 520 亿;而公司公告给出的数字是总参数量 1 万亿、激活参数 490 亿。来源没有解释这些数值为何不同。因此,注明来源并分别列出两种说法,比将它们合并成一个数字更准确。
文档列出的上下文窗口为 100 万 token。若要规划长请求,建议在实际使用的 API 版本上确认这一规格:随着文档更新,预览版的参数可能会进一步明确。
基准测试衡量的是具体任务
Mistral 报告称,模型在 DeepSWE v1.1 上得分为 61.7%,在 Terminal-Bench 4 上为 28.3%,在 AutomationBench 上为 59.9%。这些是公司针对特定测试公布的结果,分别涉及具备智能体行为的软件开发任务、终端工作流和业务流程自动化。可将这些数据作为选择测试项目的参考,而不应视为衡量模型质量的统一标准。
为了作出实际决策,开发者可以针对项目中的若干代表性任务重复测试:记录模型版本、提示词和设置,使用测试验证结果,并将重试成本纳入考量。这样的测试能够说明,已公布的结果在多大程度上适用于特定代码、文档或智能体工作流。
开放权重是下一阶段
Mistral 表示,计划在完成额外的红队测试后,于 10 月底发布权重。这是公司的未来计划;截至文章发布时,已确认的 Large 4 使用方式是公开 API 预览。对于需要自有基础设施并希望自行管理模型的团队来说,关键节点将是权重及相关使用条款的实际发布。
目前,开发者可以通过 API 测试模型的可用性、功能和质量,并将是否迁移到自有环境的决定推迟到权重发布之后。在发布初期,与其关注对比性宣传,不如重点查看基于实际任务、可复现的测试结果以及最新的价格条件。