jsonscraper

Mistral Large 4 已开放 API 预览,开放权重将稍后发布

公开预览于 10 月 6 日启动。了解目前可验证的内容,以及仍存在差异的规格数据。

10 月 6 日,Mistral 开放了 Mistral Large 4 的公开 API 预览。开发者现在可以通过 Mistral Studio 测试该模型,公司计划于 10 月底发布模型权重。截至 10 月 7 日,用户可以通过 API 评估模型,但尚无法下载其权重。对于需要在快速通过服务测试与自行部署之间作出选择的团队来说,这一状态很重要。

街道旁一栋拥有许多窗户的高楼
Shabeeba Ameen · Unsplash 许可协议

开发者目前可以使用什么

Mistral 更新日志中的条目确认了公开预览,并说明上线后的前两周提供 50% 的限时折扣。模型页面列出了对多模态输入、函数调用、结构化输出、批量处理和智能体工具的支持。开发者可以先在 API 中使用自己的任务测试模型,再决定是否部署。

截至核查时,模型页面显示的价格为:每百万输入 token 0.68 美元、每百万缓存输入 token 0.07 美元、每百万输出 token 2.09 美元。页面同时列出的常规价格是上述价格的两倍;折扣与上线相关,且有时限。制定预算前,建议直接查阅 Mistral 文档中的最新费率。

规格数据存在差异

Mistral 将 Large 4 描述为多模态混合专家(Mixture of Experts,MoE)架构。文档列出的总参数量为 1.05 万亿、激活参数为 520 亿;而公司公告给出的数字是总参数量 1 万亿、激活参数 490 亿。来源没有解释这些数值为何不同。因此,注明来源并分别列出两种说法,比将它们合并成一个数字更准确。

文档列出的上下文窗口为 100 万 token。若要规划长请求,建议在实际使用的 API 版本上确认这一规格:随着文档更新,预览版的参数可能会进一步明确。

任何未能体现宁静感的建筑作品都是错误的
Ashish Mehta · Unsplash 许可协议

基准测试衡量的是具体任务

Mistral 报告称,模型在 DeepSWE v1.1 上得分为 61.7%,在 Terminal-Bench 4 上为 28.3%,在 AutomationBench 上为 59.9%。这些是公司针对特定测试公布的结果,分别涉及具备智能体行为的软件开发任务、终端工作流和业务流程自动化。可将这些数据作为选择测试项目的参考,而不应视为衡量模型质量的统一标准。

为了作出实际决策,开发者可以针对项目中的若干代表性任务重复测试:记录模型版本、提示词和设置,使用测试验证结果,并将重试成本纳入考量。这样的测试能够说明,已公布的结果在多大程度上适用于特定代码、文档或智能体工作流。

开放权重是下一阶段

Mistral 表示,计划在完成额外的红队测试后,于 10 月底发布权重。这是公司的未来计划;截至文章发布时,已确认的 Large 4 使用方式是公开 API 预览。对于需要自有基础设施并希望自行管理模型的团队来说,关键节点将是权重及相关使用条款的实际发布。

目前,开发者可以通过 API 测试模型的可用性、功能和质量,并将是否迁移到自有环境的决定推迟到权重发布之后。在发布初期,与其关注对比性宣传,不如重点查看基于实际任务、可复现的测试结果以及最新的价格条件。

Keep readingGitHub推出ReviewBench:将依据发现的缺陷比较AI代码审查代理
Read the next article

相关文章

将阅读内容转化为可用的集成

探索 jsonscraper 社交数据 API、测试请求并构建下一个工作流。

查看 API