Grok 4.6ついに公開!GPT-5.6 Solと同水準モデルを低価格で提供開始!

要約
xAIが2026年8月12日に公開したGrok 4.6は、GPT-5.6 Solと同等の知能指数を持ちながら出力トークン単価を5分の1に抑えたモデルです。agentタスクや法律評価で優位性を示す一方、コーディング系では逆転される領域もあります。用途別の使い分け判断を具体的な数値とともに解説します。
「知能は同じなのに、なぜ価格が5倍違うのか」。そう問い直す機会を与えるモデルが登場しました。
xAIが公開したGrok 4.6は、外部の評価機関であるArtificial AnalysisのインデックスでGPT-5.6 Solと同スコア61を記録しています。それでいてAPIの出力トークン単価はGPT-5.6 Solの5分の1です。
agentタスクを繰り返し回す現場では、モデルのコストが積み上がる速度が全く異なります。この価格差が何を意味するか、ベンチマークの実数値とともに整理します。
この記事の対象読者
- agentワークフローやバッチ処理でLLM APIを大量に呼び出しているチーム
- GPT-5.6 SolとGrok 4.6のどちらを使うべきか判断したい開発者・技術責任者
- 法律・文書評価系のagentを構築・運用している担当者
- LLM API料金の最適化を検討している企業のIT・DX推進担当
Grok 4.6の公開日時・提供チャネルと価格
xAIの公式発表によると、Grok 4.6は2026年8月12日に公開されました。
利用できるチャネルはCursor・Grok Build・API・OpenRouter・Vercel・Cloudflareの6経路です。公開から最初の1週間は、Grok BuildとCursorの利用枠が通常の2倍に拡張されています。
APIの価格は入力$2・出力$6(百万トークン)で、Grok 4.5から据え置き。Fast版はその2倍の料金体系です。
| モデル | 入力($/1Mトークン) | 出力($/1Mトークン) |
|---|---|---|
| Grok 4.6 | $2 | $6 |
| Grok 4.5 | $2 | $6 |
| GPT-5.6 Sol | $5 | $30 |
xAI公式の価格表とOpenAI公式の価格表を並べると、出力トークンで5倍の開きがあることが確認できます。agentが長い出力を繰り返すほど、この差は累積します。

ベンチマーク全数値と得意・不得意の分布
xAI公式が公開したベンチマーク結果を以下に示します。数値はすべて公式発表の実数です。
| ベンチマーク | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol |
|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 |
| AA-Briefcase | 1577 | 1313 | 1502 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% |
| FrontierCode v1.1 | 61.3% | 56.6% | 60.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% |
| Harvey LAB | 15.8% | 12.9% | 2.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% |
agentタスクの評価であるAPEX-AgentsではGrok 4.6が57.5%と首位。法律タスクのHarvey LABでは15.8%対2.5%と大差をつけています。
一方、コーディング自動化のDeepSWE v1.1ではGPT-5.6 Solが73%とGrok 4.6の65.9%を上回ります。Terminal-Bench v3.0も同様で、GPT-5.6 Solが34.6%に対しGrok 4.6は26%です。
今回の改善の重点と価格据え置き戦略の背景
xAIの公式発表は、今回の改善重点を「長時間動くagentタスク」と「対話・視覚を伴う作業」と説明しています。
APEX-AgentsやHarvey LABでの数値の伸びは、この方向性と一致しています。GDPVal-AA v2の1753はGPT-5.6 Solの1728を上回り、長時間agentの評価で優位性を示しています。
価格をGrok 4.5から据え置いたことは、同等の知能水準のモデルを安価に使い続けられる環境を維持する選択です。これがAPIコストに敏感な現場への訴求になっています。
agentを大量実行する現場でのコスト試算と使い分け
出力5倍の価格差は、agentが多くのトークンを生成するワークフローほど効いてきます。
たとえば月間1億トークンを出力するagentシステムでは、GPT-5.6 Solなら$3,000かかるところ、Grok 4.6では$600で済む計算になります。この差がスケールすると、年間コストで数百万円単位の開きになり得ます。
用途別の判断軸として、私たちが見てきた範囲では次のように整理できます。
- 【Grok 4.6が向く用途】法律・契約レビュー、長時間agentワークフロー、大量バッチ処理での文書評価
- 【GPT-5.6 Solが向く用途】コード自動生成、ターミナル操作を伴うdevops系agent、DeepSWEスコアが重要な自律コーディング
同じ「agentタスク」でも、コードを書くのか文書を評価するのかで最適なモデルが変わります。一律に切り替えるのではなく、タスクタイプごとに使い分けることが実コスト削減の近道です。

自社のagentコスト最適化を進める際に詰まりやすいポイント
Grok 4.6への切り替えを検討する際、現場でよく起きる障壁が3つあります。
- タスク分類ができていない: どのagentが何のタスクを処理しているか棚卸しされていないと、コーディング系か文書評価系かの判断自体ができない。
- ベンチマークと自社タスクのずれ: 公式ベンチマークは特定の評価セットで測定されており、自社の実ワークフローでの品質差は別途検証が必要になる。
- 切り替えコストの過小評価: プロンプトの最適化・出力パーサーの調整・エラーハンドリングの見直しが発生し、切り替え工数が想定より大きくなる場合がある。
これらの障壁を外部支援で埋める場合、業務タスクの棚卸しから始めることで「どのagentを切り替えるべきか」の優先順位が明確になります。
BinxAIのみっちゃくんは月額5万円から、AIアドバイザーとして業務タスクの棚卸しや定例会にご利用いただけます。初期費用はありません。データ基盤の整備や業務アプリ開発は、範囲に応じて別途ご相談ください。

よくある質問
Grok 4.6はいつから使えますか?
xAIの公式発表によると2026年8月12日に公開済みです。Cursor・Grok Build・API・OpenRouter・Vercel・Cloudflareからすぐに利用を開始できます。
GPT-5.6 Solと比べてどちらが賢いですか?
Artificial Analysisのインデックスでは両モデルがスコア61で同値です。xAI公式のGDPVal-AA v2やAPEX-AgentsではGrok 4.6が上回り、DeepSWEやTerminal-BenchではGPT-5.6 Solが上回ります。「どちらが賢い」よりもタスクタイプで向き不向きが分かれると考える方が実態に近いでしょう。
Grok 4.6 Fastとの違いは何ですか?
xAI公式の価格表では、Fast版は標準版の2倍の料金(入力$4・出力$12)です。応答速度を優先する用途向けの設定で、モデルの能力自体は同一と説明されています。
コーディングagentにGrok 4.6を使うのは得策ですか?
公式ベンチマークではDeepSWE v1.1がGrok 4.6:65.9%、GPT-5.6 Sol:73%と差があります。コード自動生成やターミナル操作が中心のagentでは、価格の安さと品質のトレードオフを自社ワークフローで検証してから判断することをお勧めします。
OpenRouterやVercelからも同じ価格で使えますか?
xAI公式の発表では、Cursor・Grok Build・API・OpenRouter・Vercel・Cloudflareの6チャネルでGrok 4.6を利用できると説明しています。各プラットフォーム固有のマークアップが加算される場合があるため、実際の料金は各サービスの価格ページで確認してください。
参考・出典
Grok 4.6は「同水準の知能を出力5分の1のコストで使える」という選択肢を現実のものにしました。
agentや法律評価では数値上の優位性があり、コーディング系では逆転される領域もあります。タスクの性質を棚卸しし、用途ごとにモデルを使い分けることが、API料金を実際に下げる唯一の道筋です。
この記事の分類
同じ分類の記事をまとめて読めます。
次に読む記事

Claude Opus 5とFable 5は別物です。取り違えると費用が2倍になります
AnthropicのClaude Opus 5とClaude Fable 5は、名前が似ていますが別のモデルです。料金は100万トークンあたり入力5ドルと10ドルで2倍違います。現在のラインナップと、モデルIDの固定・提供終了・依頼の拒否という運用で効いてくる仕様を、公式ドキュメントをもとに整理します。

JiraがAIエージェントの司令塔になる。要件定義自動化とClaude Code連携の意味
アトラシアンがJiraにAI要件定義の自動作成・タスク自動割り当て・Claude CodeやGitHub Copilotとの連携機能を発表した。プロジェクト管理ツールがAIエージェントのオーケストレーション基盤へと役割を拡張するこの動きが、開発現場の実務にどう影響するかを整理します。

Mistral Agentic Search登場 文書検索は答えを探すだけで終わらない
Mistral AIが発表したAgentic Searchは、文書を検索して終わらず、閲覧と検証を重ねて回答を組み立てます。従来のRAGとの違い、社内文書への適用領域、コストと権限管理の注意点を整理します。














