Zademy

MiniMax M3:100万トークン、ネイティブマルチモーダル推論、そしてコーディングエージェントへの中国の賭け

ツール
MiniMax; M3; LLM; Multimodal; Agents; AI
words 単語

先週、中規模のリポジトリを読ませて構造的な変更を出させる、そんな副業プロジェクトでモデル選びをしていた。いくつか比較しているうちに MiniMax M3 が目に入った。予想外だった。GPT-4o、Claude 4、Gemini 2.5 Pro と張るものを作っているという噂は聞いていたが、この中国の会社はここ数ヶ月自分のレーダーから消えていた。100万トークンのコンテキスト、ネイティブマルチモーダル、コーディングとエージェントへのフォーカス。その数字を見て、手が止まった。

ベンチマークに飛びついたわけではない。ベンチマークはもう疲れた。手が止まったのは、M3 が不愉快なほど鋭い問いを突きつけてきたからだ。コードベース全体を読み、ドキュメントを理解し、バグのスクリーンショットを見て、コンテキストを手組みしなくてもパッチを提案できるモデルが現れたら、何が変わるのか。それが約束だ。だから確かめに行った。

マーケティング抜きで M3 とは何か

MiniMax M3 は、中国の AI スタートアップ MiniMax の最新モデルだ。同社はすでに言語、動画、音声生成モデルを作ってきたが、M3 でそれらを単一の汎用マルチモーダルモデルに統合しようとしている。ただし、ねじれがある。別のチャットボットとして売るのではなく、ソフトウェアエンジニア、自律エージェント、長いワークフローのために作ったモデルだと位置づけている。

公式発表によると、M3 の主な特徴は次の通りだ。

  • 100万トークンのコンテキストウィンドウ。英語で約75万語。中規模プロジェクトを複数、丸ごと入れられる。
  • ネイティブマルチモーダル推論。画像、動画、音声を別のビジョンモジュールに通さず、モデルが直接処理する。
  • コーディングへの強い注力。SWE-bench スタイルのタスク、複数ファイルのリファクタリング、コードベースの理解で強い主張をしている。
  • エージェンティックな能力。ツールの使用、複数ステップの計画、自律的な実行。
  • MiniMax API と Hailuo AI のようなコンシューマ製品を通じた提供。

メッセージは明確だ。最高のチャットになりたいのではない。プログラマーやエージェントが仕事を進めるために使うエンジンになりたいのだ。

100万トークンは数字ではなくワークフローの変化

128K や 200K トークンのモデルは使ってきた。便利だが、いまだに同じ手作業を繰り返す。コードスニペットをコピーし、issue を要約し、ドキュメントを貼り付け、3メッセージ前の会話をモデルに思い出させる。何もないよりマシだが、プログラミングの仕方は変わらない。

100万トークンになると、方程式が変わる。理論上、以下が全部入る。

  • 中規模アプリケーションの src/ 全体。
  • 完全な API ドキュメント。
  • issue tracker の会話をいくつか。
  • バグのスクリーンショット数枚。
  • それでもレスポンス用の余裕が残る。

私が気にするのは、モデルがより多くを理解するかどうかではない。そのすべての関係性を理解できると信頼できるかどうかだ。使い方の下手な長文脈は、整理されたノイズに過ぎない。

最初のテストは、約4万行の TypeScript リポジトリをアップロードし、2つのモジュール間で共有ステートがどこで扱われているか特定させることだった。回答は構造的に正しかったが、テストに現れていたエッジケースを見落としていた。妥当だと思った。モデルは森を見た。足りない木は自分で確認する。

ネイティブマルチモーダル:なぜ開発者にとって重要か

これまでモデルに「見て」ほしいとき、選択肢は GPT-4V、Claude with vision、Gemini あたりだった。動くが、いつも拡張機能をテープで貼り付けたような感じがする。言語モデルがテキストを処理し、時々別のシステムが生成した画像説明を受け取る。

MiniMax は M3 がそうではないと言う。アーキテクチャが根本からマルチモーダルだ。テキスト、画像、動画を横断する推論が一貫性を失わずに行えるはずだ。エンジニアとして、これには具体的な用途がある。

  • ビジュアルデバッグ。ブラウザのエラースクリーンショットを送ると、モデルが UI とコードを関連付ける。
  • デザインドキュメント。モックアップをアップロードして、コンポーネント構造の生成を頼む。
  • PR レビュー。diff、結果の画像、チケットの説明を同時に見られる。
  • 迅速なプロトタイピング。画像やワイヤーフレームから動作するコードへ、一ステップで。

テストですべてが完璧に動いたわけではない。単純なスクリーンショットはよく理解したが、情報密度の高い UI では存在しないクラス名を作り始めた。この段階では普通のことだ。重要なのは、分離されたビジョンパイプラインより天井が高そうだということだ。

コーディングとエージェント:最も難しい領域

ここが最も懐疑的だったところだ。言語モデルは孤立したコード片には強い。だが、既存システムで正しい変更を行うこと、慣例、テスト、依存関係を尊重しながら変更することは、いまだ最大の未解決問題だ。

MiniMax M3 はこれに最適化されていると主張している。発表では次のようなタスクが挙げられていた。

  • 説明とコードベースから GitHub issue を解決する。
  • 一貫性を保ちながら複数ファイルのコードをリファクタリングする。
  • 最近の変更からユニットテストを生成する。
  • 複数のツールを使うエージェンティックなフローを実行する。

簡単なものから試した。React のフォームにバリデーションを追加し、コンポーネント、バリデーションスキーマ、テストに変更を加えるよう頼んだ。回答は使えるものだった。完璧ではない。プロジェクトにないバリデーションライブラリを使い、エラーメッセージで英語とスペイン語を混ぜた。だが変更の構造は正しく、時間を節約できた。

次に、もっと野心的なことを試した。コンポーネントからビジネスロジックを custom hook に移すリファクタリングを提案してもらう。そこで興味深い失敗をした。hook は動いたが、DOM イベントに依存した副作用を見落としていた。モデルは形を尊重したが、振る舞いを尊重していなかった。これは製品の文脈を持つ人間にしか捕まえられない種類のエラーだ。

競合は眠っていない

M3 を語るとき、地図の上に置かずに語る意味はない。今日、コード用のモデルを選ぶなら強い選択肢がある。

  • Claude 4 Sonnet/Opus:長く慎重な技術的推論における自分の基準はまだここ。
  • GPT-4o / o3:指示追従とツールの使い方に非常に長けている。
  • Gemini 2.5 Pro:200万トークンで、長文脈とマルチモーダルで明確な優位性。
  • DeepSeek-V3:コーディングと推論においてコストパフォーマンスが優秀。

MiniMax M3 は Gemini と Claude の交差点に座ろうとしているようだ。長文脈、マルチモーダル、エージェント。違いは中国由来であり、実務的な影響がある。

  • アクセスとレイテンシ:あなたの場所と使うインフラによる。
  • コンプライアンスとデータ:企業環境で働くなら、情報がどこで処理されるか確認する必要がある。
  • 言語:自分のテストでは英語と中国語で良好だった。スペイン語では使えるが、技術的なニュアンスでは Claude や GPT-4o ほど洗練されていない。

価格、API、始め方

MiniMax は M3 を API で提供している。ドキュメントには completions や chat の標準エンドポイント、ツール使用とマルチモーダル入力のサポートが挙げられている。価格は変動が速く、今日時点で検証していないため具体的な数字は書かない。必要なら MiniMax Models の公式ページを確認してほしい。

始め方は他のプロバイダーと似ている。

  1. MiniMax アカウントを作成する。
  2. API key を生成する。
  3. curl または言語用 SDK でテストする。
  4. ベンチマークではなく、自分の実際のタスクでレイテンシと品質を測る。

プロジェクト全体を一晩で移行することはおすすめしない。おすすめするのは、1週間かけて M3 を具体的なタスクで試すことだ。リファクタリング、レガシーコードの分析、テスト生成、PR レビュー。そこで初めて、本当にワークフローを変えるのか、それともただのモデルなのかがわかる。

気に入った点

  • 100万トークンのコンテキストウィンドウは小さなマーケティングではない。中規模リポジトリでは、コードとの関わり方が変わる。
  • ネイティブマルチモーダルは古典的なビジョンパイプラインより統合感がある。
  • エージェントとコーディングへのフォーカスは誠実だ。すべてで優れようとするのではなく、技術的な作業を狙っている。
  • 基盤モデルの競争がまだ開かれているサインだ。2〜3プレイヤーの市場ではない。

懸念点

  • 強い主張、少ない証拠。販促用のベンチマークは、実体験よりいつも美しく見える。
  • スペイン語やその他の非ヨーロッパ言語での品質。自分のテストでは混在した結果だった。もっと時間が必要だ。
  • ツールエコシステム。Claude には Cursor、GPT-4o には GitHub Copilot、Gemini には Google 統合がある。MiniMax は中国国外でそのエコシステムをまだ構築中だ。
  • 透明性。アーキテクチャ、学習データ、独立した評価に関する公開情報が、Anthropic、OpenAI、Google より少ない。

現時点での結論

MiniMax M3 は真剣な提案だ。ニッチモデルでも実験でもない。ソフトウェアエンジニアが使うものの核心、コードを理解し、変更し、複雑なシステムを推論することを直接狙っている。

だが、他のすべてを時代遅れにする革命でもない。長文脈とマルチモーダルで明確な強みがあり、メイン市場外でのエコシステムと成熟度には実際の弱さがある、もう一つの選択肢だ。

今後数週間、使い続ける。もし考えが変わったら、良くも悪くも、更新を書く。現時点での推薦は単純だ。どんなベンチマークを信じる前に、自分のコードで試せ。数字は売るが、コードは嘘をつかない。

リソース