jsonscraper

Mistral Large 4、APIで提供開始—オープンウェイトは後日公開予定

パブリックプレビューは10月6日に開始。現時点で確認できる情報と、仕様の食い違いを解説します。

10月6日、MistralはMistral Large 4のパブリックAPIプレビューを開始しました。開発者はすでにMistral Studioからモデルをテストでき、ウェイトは10月末に公開する予定です。10月7日時点ではAPI経由で評価できますが、ウェイトはまだダウンロードできません。この状況は、サービスですぐにテストするか、自前でデプロイするかを選ぶうえで重要です。

道路沿いに建つ、窓がたくさんある高層ビル
Shabeeba Ameen · Unsplashライセンス

開発者が今利用できる機能

Mistralの変更履歴では、パブリックプレビューの開始と、開始から2週間に限り適用される50%の割引が確認できます。モデルの説明ページには、マルチモーダル入力、関数呼び出し、構造化出力、バッチ処理、エージェント向けツールへの対応が記載されています。これにより開発者は、デプロイを決める前にAPI上で自分たちのタスクを使ってモデルを検証できます。

確認時点のモデルページでは、入力トークン100万個あたり0.68ドル、キャッシュされた入力トークン100万個あたり0.07ドル、出力トークン100万個あたり2.09ドルと表示されています。通常料金はその2倍と併記されており、この割引はローンチに伴う期間限定のものです。予算を見積もる前に、Mistralのドキュメントで料金を直接確認してください。

仕様には食い違いがある

MistralはLarge 4を、Mixture of Experts(MoE)を採用したマルチモーダルモデルとして説明しています。ドキュメントでは総パラメーター数が1.05兆、アクティブパラメーター数が520億とされていますが、同社の発表ではそれぞれ1兆、490億と記載されています。数値が異なる理由は、どちらの情報源にも説明されていません。そのため、単一の数値にまとめるのではなく、出典を明記して両方の記載を伝えるのが正確です。

ドキュメントによると、コンテキストウィンドウは100万トークンです。長い入力を計画する際は、実際に使うAPIのバージョンでこの仕様を確認するとよいでしょう。プレビュー期間中は、ドキュメントの更新に伴って仕様が明確になる可能性があります。

静けさを表現していない建築作品は、すべて誤りである
Ashish Mehta · Unsplashライセンス

ベンチマークは個別のタスクを示す

Mistralは、DeepSWE v1.1で61.7%、Terminal-Bench 4で28.3%、AutomationBenchで59.9%の結果を報告しています。いずれも特定のテストに対して同社が公表した結果で、順にエージェント的な振る舞いを伴う開発タスク、ターミナル上のワークフロー、ビジネスプロセスの自動化を評価するものです。モデルの品質を単一の指標で表すものではなく、どのような検証を行うかを決めるための目安として捉えるのが有用です。

実際に導入を判断する際は、開発者がプロジェクトを代表するタスクをいくつか再実行し、モデルのバージョン、プロンプト、設定を記録したうえで、テストによって結果を確認し、再試行のコストも考慮するとよいでしょう。こうしたテストによって、公表された結果が自分たちのコード、文書、エージェントワークフローにどの程度当てはまるかが分かります。

オープンウェイトの公開は次の段階

Mistralは、追加のレッドチームテストを経て、10月末までにウェイトを公開する計画だと発表しました。これは同社が示した今後の予定であり、記事公開時点で確認されているLarge 4の利用方法はパブリックAPIプレビューです。自社インフラでの運用やモデルの自主管理が必要なチームにとって、次の重要な節目は、ウェイトの実際の公開と利用条件の発表です。

現時点では、開発者はAPIを通じて利用可能性、機能、品質を検証し、自社環境への移行判断はウェイトの公開後まで保留できます。開始直後に特に役立つのは、比較をうたう主張ではなく、実務タスクを使った再現可能なテストの結果と、最新の料金条件です。

People

No people listed for this article yet.

Keep readingGitHub、ReviewBenchを公開:AIコードレビュアーを欠陥の検出数で比較
Read the next article

関連記事

Breaking News · ニュース

GitHub、ReviewBenchを公開:AIコードレビュアーを欠陥の検出数で比較

10月5日、GitHubはコードレビューエージェント向けベンチマーク「ReviewBench」の研究プレビューを発表しました。指摘の検出、見逃し、不要な指摘をそれぞれ評価します。同社の社内A/Bテストの結果は個別の実験に関するものであり、モデル全般のランキングではありません。

読んだ内容を実用的な連携へ

jsonscraperのソーシャルデータAPIを調べ、リクエストを試し、次のワークフローを構築しましょう。

APIを探す