Blank white background with no objects or features visible.

Ask TFY:AIゲートウェイ内のあらゆる事象をデバッグ、分析、実行 詳細はこちら

TrueFoundryはSeldon AIの買収を発表し、エンタープライズAI向けコントロールプレーンを拡張します。プレスリリース全文はこちら→

Gemini 3 vs Kimi-K2 Thinking vs Grok-4.1 vs GPT-5.1: Who Actually Wins Humanity’s Last Exam?

Published: July 6, 2026

Googleが「 何でも計画できる」 とGemini 3で言うとき、MoonshotはKimi-K2 Thinkingが 新しい推論SOTAであると主張し、xAIはGrok-4を「世界で最もインテリジェントなモデル」と呼び、OpenAIはGPT-5.1を推し進め続けている状況では、何が真実で何が単なる雰囲気なのかを見極めるのは難しい。

またベンチマークのグラフばかりではなく、ここではより絞り込んだ問いを立ててみましょう。

Gemini 3、Kimi-K2 Thinking、Grok-4.1、GPT-5.1を、Humanity’s Last Examスタイルの同じ問題群に適用し、実際に どのように 考えるかを観察したらどうなるでしょうか?

この記事では:

  • なぜ Humanity’s Last Exam (HLE) が学術ベンチマークの「ラスボス」となったのか。

  • Gemini 3、Kimi-K2 Thinking、Grok-4.1、GPT-5.1 を「思考」モデルとして簡単に紹介。

  • 5つの具体的なHLEスタイルのケーススタディ 数学、マルチモーダル物理学、長文コンテキスト科学、ゲーム理論、プランニングにわたる。

  • 方法 同じ実験を自分で行う TrueFoundry AI Gateway を介して。

1. 人類最後の試験を2分で

MMLUのようなベンチマークは、最先端では基本的に「やり尽くされています」。多くのトップモデルはそこで90%を超えており、別のモデルが±1%の差であっても、実際にそれらを扱う上でどのようなものかについては、あまり分かりません。

人類最後の試験(HLE) は異なります。

  • これは、専門家が厳選した試験で、 数学、自然科学、工学、経済学、人文科学、法学などにわたります。

  • これは 多肢選択式と完全一致式 の問題が混在しており、その多くは いくつかの自明ではない推論ステップを必要とします

  • 質問の一部は マルチモーダルであり、モデルはテキストと画像を統合して推論する必要があります。

  • 重要なことに、今日の最高峰のモデルでさえ、いまだに 人間の専門家レベルには遠く及びません HLEに関するもので、その自信はしばしば不適切に調整されています。

著者らは、人々に明確に求めています 元の質問を再公開しないよう、HLEが長期的に有用なベンチマークであり続けることを望んでいるためです。そこで、この記事では、

  • 本稿では 示しません いかなる質問の元の文言も。

  • その代わりに、本稿では 5つの代表的な「HLEスタイル」のタスク と、それらのタスクでモデルがどのように振る舞うか。

これらのパターンは、公開されているHLEデータセット、またはご自身のドメインにおける同様の問題を使用して、ご自身で再現できます。

2. 2025年の4つの「思考」モデル

ここでは「チャットボット」を比較しているのではなく、明確に~として売り出されているモデルに着目しています。 推論器:深い思考連鎖、ツール、長いコンテキスト、プランニング。

Gemini 3(Pro + Deep Think)

Googleは Gemini 3を これまでで最も高性能なモデルとして発表しています:

  • より強力な 推論マルチモーダル理解 Gemini 2.5世代よりも優れています。

  • ツールなしのHLEで高いスコアを記録し、GPQA、MMMU-Pro、Video-MMMU、その他の推論ベンチマークでも優れた性能を発揮しています。

  • 長期的視野を持つツール呼び出しエージェントに重点を置いており、「何でも計画できる」というコンセプトのもと、Vending-Benchのような計画ベンチマークで最高の成績を収めています。

Gemini 3はまた、 Deep Think モードを搭載しており、難しい問題に対してより多くの計算資源とトークンを費やし、わずかながら精度を向上させます。

Kimi-K2 Thinking

Moonshotの Kimi-K2 Thinking は、オープンウェイトの「思考」モデルです。

  • 総パラメータ数は膨大ながら、トークンあたりのアクティブなサブセットは小さいMixture-of-expertsアーキテクチャ。

  • 長いコンテキスト(数十万トークン)と 非常に重厚な思考連鎖 が設計によるものです。

  • 公開されている分析では、Kimi-K2 Thinkingとその「Heavy」バリアントが、HLEやその他の推論ベンチマークで常にトップまたはそれに近い位置にあることが示されています。

もしあなたが、モデルが 何ページにもわたる内省を吐き出すのを見たことがあるなら 1つの数学の問題に対して:それがKimi流の美学です。

Grok-4 / Grok-4.1

xAIの Grok-4 シリーズは次のように紹介されています。

  • 非常に高性能な 推論 モデルで、ネイティブなツール利用機能とインターネット検索機能を備えています。

  • HLE、GPQA、およびエージェントが多くのステップにわたって一貫した行動を維持する必要がある長期的タスクに優れています。

  • Grok-4.1は、「感情的」および創造的な知能にさらに焦点を当てていますが、核となる推論能力は維持しています。

Grok-4.xは、真に エージェントであろうとするモデルだと考えてください:計画し、検索し、行動し、反省し、繰り返す。

GPT-5.1 (GPT-5ファミリー)

OpenAIの GPT-5 ファミリーは、ほとんどの人が基準とするものです。

  • コーディング、推論、マルチモーダル、長文コンテキストといった幅広いベンチマークスイートに非常に優れています。

  • 高い 「推論努力」/「思考」モードで実行した場合、より多くのトークンを割り当て、難しい問題を計算し、HLEやGPQAのような高度なベンチマークとの差を縮める傾向があります。

私たちは GPT-5.1 Thinking を、その高負荷プロファイルで動作するGPT-5のバリアントと呼びます。

3. 比較方法(HLEを漏洩させずに)

ここでの目標は、別のリーダーボードを作成することではなく、 これらのモデルが HLE形式のタスクでどのように振る舞うかを確認することでした。

大まかな流れは次のとおりです。

  • 私たちは、 代表的なHLEの質問 (数学、マルチモーダル物理学、長文科学問題、ゲーム理論、プランニング)をいくつか選びました。

  • 各質問に対して、一貫した 「試験モード」プロンプトを使用しました。

    • 「段階的に推論してください。」

    • 「思考プロセスを説明してください。」

    • 「最後に『Final answer: …』と『Confidence: …』で締めくくってください。」

  • まったく同じ質問とスキャフォールドを以下の対象に適用しました。

    • Kimi-K2 思考

    • Grok-4.1

    • GPT-5.1 思考

    • Gemini 3 Pro (利用可能な場合は、 Gemini 3 Deep Think

これらすべては、 TrueFoundry AI Gatewayを介して接続されました。

  • OpenAI、Google、xAI、Moonshot、その他1000以上のモデルを接続できる単一のエンドポイント。

  • 応答、トークン、レイテンシー、呼び出しごとのコストを記録する単一の場所。

  • ベンダーを横断する認証、クォータ、ガードレールの単一セット。

それについては後ほど詳しく説明します。まずは、5つのケーススタディを見ていきましょう。

4. ケーススタディ1 – 深い数学:精度 vs トークン消費型思考

タスク
大学院レベルの数学の問題(数論や組み合わせ論を想定):

  • 単一の短い回答(整数または単純な式)。

  • 約4〜6の自明ではない推論ステップが必要。

  • 実際にやってみないと、正しく推測するのは非常に難しい。

私たちが注目する点

  • モデルは 構造を適切に設定しているか 正しく設定しているか(例:適切な定理や分類など)?

  • マイナス記号を失うことなく、最後まで推論を完遂しているか?

  • どれくらいの トークンを 消費しているか?

  • その自信はどれくらい 適切に調整されているか

観察された典型的なパターン

  • Kimi-K2の思考

    • 非常に長い思考の連鎖:関連する定理を想起し、複数の候補アプローチを検討し、しばしば分岐して後戻りする。

    • 精度は非常に高い(特に「ヘビー」モードで)が、他のモデルよりもはるかに多くのトークンを消費することが多い。

    • 自己申告の自信度は、かなりデリケートな問題であっても、頻繁に90~100%である。

  • Grok-4.1

    • 大胆かつ探求的:直感的な答えを素早く導き出し、それを正当化しようと試みる。

    • 正しいときは見事に見えますが、間違っているときは 非常に 自信過剰です。

  • GPT-5.1 Thinking

    • 優れた構造:ケースを明確に列挙し、ラベルを付け、参照も明確に行います。

    • 特に複数の深い事実を必要とする問題の場合、自信の推定はやや控えめであることが多いです。

  • Gemini 3 (Pro / Deep Think)

    • 多段階の推論ですが、著しく 簡潔です Kimi-K2の長文よりも。

    • Deep Thinkモードは、Kimi/GrokとのHLEのギャップの多くを埋めつつ、説明はやや控えめです。

まとめ
もしあなたが あらゆる追加のポイントを HLEスタイルの数学で、Kimi-K2 ThinkingとGrok-4.xがリーダーのように感じられ、Gemini 3 Deep Thinkが僅差で続きます。もしあなたが コストと速度を 生の精度と同じくらい重視するなら、Gemini 3とGPT-5.1 Thinkingは、トークン消費量が少ないにもかかわらず同様の結果を達成するため、魅力的です。

5. ケーススタディ2 – マルチモーダル物理学:「実際に図を見る」

課題
図を多用する物理学・工学の問題:

  • 回路図、自由体図、または光学系の構成図が画像として埋め込まれている。

  • 問題は数値的な答え(例:電流、角度、時間)を求めている。

  • ~なしでは正しく答えられない 図を読み解く 適切に。

評価項目

  • モデルは 記述しているか 図と一致するように記述しているか?

  • それは 示されていない仮定を立てていないか 画像に示されていない仮定を立てていないか?

  • 画像とテキストをどれだけうまく組み合わせて、首尾一貫した導出を行っているか?

観察された典型的なパターン

  • Gemini 3

    • 画像そのものについて非常に詳細に記述する:「矢印は左を向いている」、「3つの抵抗が直列に接続されている」、「質量は2つのバネで取り付けられている」。

    • 図の内容に関する幻覚が少ない。

    • 全体的に最も 堅実な マルチモーダルな推論において。

  • GPT-5.1の考察

    • マルチモーダルな理解力は高いものの、説明が不足しがちです。図を正しく利用しますが、常に詳細に記述するわけではありません。

    • 失敗する場合、それは画像ではなく、テキストの読み間違いによることが多いです。

  • Kimi-K2の考察

    • 与えられた条件が正しければ、物理的な推論は堅実です。

    • しかし、負荷がかかると、図中の要素(例:コンポーネントの数)を誤って数え、その誤りが非常に長い導出過程全体に波及することがあります。

  • Grok-4.1

    • GPT-5.1と似たスタイルで、直感的で正解することも多いですが、線やラベルの誤解釈に対して時折過信することがあります。

まとめ
HLEスタイルの作業負荷の多くが 図、回路図、または視覚的なパズルを伴う場合、Gemini 3のマルチモーダルスタックは際立っています。GPT-5.1、Kimi-K2、Grok-4.1もすべて有能ですが、実際には存在しない詳細を「見てしまう」傾向がより強いです。

6. ケーススタディ3 – 長文コンテキストの科学:解決だけでなく読解も

課題
長文で内容の濃い科学の文章(生物学・医学・化学分野):

  • 実験、方法、結果、注意点を記述した複数の段落。

  • そして、〜を必要とする質問 文章全体にわたる情報の統合、最後の段落だけでなく。

評価のポイント

  • モデルは 要約する 文章を正確に要約しているか?

  • モデルは 変数、条件、例外 を段落全体にわたって把握しているか?

  • 質問に答えるために、どの詳細が 実際に重要であるか を正しく特定しているか?

見られた典型的な傾向

  • Gemini 3

    • 長文を〜に要約するのが得意 的を絞った箇条書き.

    • 主要な事実を再述し、その後「メモから」答えを導き出す傾向がある。

    • 文章の以前の部分を参照する際に、自己矛盾することはめったにない。

  • GPT-5.1の思考

    • 変数や実験設定の追跡に優れており、まるで丁寧なTAのようだ。

    • 「読み込み → 要約 → 推論」の流れが最も明確であることが多い。

  • Kimi-K2の思考

    • 非常に詳細で、文章の多くを繰り返し、時には背景理論を再導出することもある。

    • その詳細さは有用だが、膨大な長さゆえに、時折、逸脱や内部矛盾が生じることがある。

  • Grok-4.1

    • 抽出するのが非常に得意 実用的な示唆 (「これは、~の場合に治療Aが望ましいことを示唆している」など)

    • テキストで言及されている稀な特殊ケースを、時として軽く扱うことがある。

要点
HLEスタイルの 「これを読んで、ちゃんと理解してください」 質問に対しては、Gemini 3とGPT-5.1 Thinkingが特に優れています。要点を的確にまとめ、重要な詳細を保持し、論理を一貫させます。Kimi-K2とGrok-4.1も有能ですが、説明が長くなると論点がずれる可能性が高まります。

7. ケーススタディ4 – ゲーム理論とミクロ経済学:TAのように推論するのは誰か?

タスク
ミクロ経済学・ゲーム理論の質問:

  • 複数のプレイヤー、限られた行動選択肢、および利得の記述。

  • 求められるのは、均衡を見つけたり、戦略を特徴づけたり、あるいは厚生の結果を比較することです。

着目点

  • モデルは 関連するすべてのケースを列挙しているか

  • ケース分析から最終回答まで、論理の一貫性を保っているか?

  • 混合戦略、支配戦略、対称性といった機微を理解しているか?

よく見られるパターン

  • Kimi-K2の思考

    • 大学院生のTAのように、ケースバイケースの分析を多く行い、反例を明確に構築し、エッジケースを慎重に検討します。

    • 推論の全体像を見たい場合に非常に優れています。

  • Grok-4.1

    • 直感的に非常に長けている インセンティブ推論 (「もしプレイヤーAが逸脱すればXを得るので、これは均衡ではない」)。

    • 時折、早い段階で直感的な均衡に固執しがちで、再考を促す必要がある。

  • GPT-5.1の思考

    • 体系的:ケース(ケース1、ケース2など)にラベルを付け、結果を要約し、それらをスムーズに結びつける。

    • 深さと簡潔さのバランスが良い。

  • Gemini 3

    • 構造はGPT-5.1に似ているが、特にディープシンクのようなモードでは、明示的に立ち戻る傾向がやや強い(「〜という仮定を再考しよう」など)。

要点
ゲーム理論的なHLEの質問において、 Kimi-K2の思考Grok-4.1 は人間のティーチングアシスタントに最も近いと感じられる:明示的なケース分析と直感的な議論が多い。 Gemini 3GPT-5.1 迷うことが少なくて済むため、アウトプットをコードやデシジョンパイプラインに直接パイプする場合に便利です。

8。ケーススタディ 5 — 計画上の問題:プロンプト内のミニエージェント

タスク
計画/運用調査スタイルのパズル:

  • 複数のコンテナ、容量、注入ルール、またはスケジューリング/在庫管理の設定。

  • で目標を達成するポリシーまたは一連のアクションを選択する必要があります 最小ステップ 制約の下で。

私たちが見ているもの

  • モデルはそうですか ステートスペースを設定する 明らかに?

  • 以前のアクションを忘れずにシーケンスを正しくシミュレートできますか?

  • それ自体が述べた制約に固執していますか?

観察された典型的なパターン

  • グルーク-4.1

    • 非常にエージェント的な感じで、状態を明示的に書き出し (「ステップ3の後:インベントリはX、Y、Z」)、それぞれを目標と照合し、必要に応じてコース修正を行います。

    • 1つのプロンプトで実際のプランニングエージェントを使用することに最も近いと感じます。

  • ジェミニ 3

    • 同様の計画スタイル:目的と制約を再確認し、ポリシーを提案し、いくつかのステップをシミュレートします。

    • 特に得意なのは 道に迷わない ロングホライズン/ベンディングベンチのピッチと相性が良く、長いシーケンスでのステートの再現性が高いです。

  • GPT-5.1 思考

    • 概念計画は良好だが、多くのステップで小さな算術ミスや簿記ミスが起こりやすい。

    • 「最短シーケンス」を保証するように求められた場合、2回目の試行が必要になる場合があります。

  • キミ-K2 思考

    • 詳細なシミュレーションを多数提供しますが、長いCoT+複雑な状態を組み合わせると、小さな不一致(たとえば、ステップ間で量が静かに変化するなど)が発生することがあります。

テイクアウト
計画重視のHLEタスクでは、 グルーク-4.1 そして ジェミニ 3 最も信頼できるミニエージェントのように感じます。Kimi-K2 と GPT-5.1 は非常に高性能ですが、状態追跡が重要な場合は、長い推論トレースが不利になることがあります。

9。では... 人類最終試験に「勝つ」のは誰?

見ているだけなら ヘッドライン HLE パーセンテージ、Kimi-K2 Thinking(特にヘビーバリアント)および一部のGrok-4構成は、現在トップまたはその近くにあります。 ジェミニ 3 ディープシンク すぐ後ろに GPT-5 プロ 少し下がって

しかし、HLEは最高の意味で厄介です。

  • 精度はまだ人間の専門家をはるかに下回っています。

  • 信頼性はしばしば誤って調整されます。モデルには 非常に 確かに 非常に 間違っている。

  • さまざまなドメイン(数学対科学対計画対人文科学)が表示されます さまざまな勝者

5つのケーススタディから:

  • キミ-K2 思考

    • 必要なときに最適 最大深度 また、トークンの支払いやレイテンシーでの支払いも快適で、パフォーマンスを最大限に引き出すことができます。

  • グルーク-4.1

    • シャインズ・オン プランニングとエージェントライクな推論; あなたのタスクがシミュレーションや複数段階のビジネス上の意思決定のようなものであれば、Grok はとても自然な感じがします。

  • GPT-5.1 思考

    • 強力で安全なデフォルト:長いコンテキストの読みやすさ、概ねクリーンな構造、そして既存のシステムへの統合が非常に簡単です。

  • ジェミニ3(プロ+ディープシンク)

    • 特に説得力がある マルチモーダル推論構造化された読解、および 計画 —そして、「何でも計画する」という売り込みは単なるマーケティングではありません。長期にわたるステートフルな問題の処理方法にも表れています。

人類最後の試験の勝者は一人もいません。「最良の」モデルは 最もひどく失敗しない 実際の制約の下で、実際のタスクを実行してください。

10。これを TrueFoundry AI ゲートウェイを通じてどのように実行したか

内部的には、4 つの個別のインテグレーションは構築していませんでした。すべてが次の段階を経ました。 トゥルーファウンドリー AI ゲートウェイ (truefoundry.com/ai-gateway):

  • 1 つのエンドポイント OpenAI (GPT-5.1)、グーグル (ジェミニ3)、XAi (Grok-4.x)、ムーンショット (Kimi-K2)、その他何百ものモデル用。

  • 一元化 オブザーバビリティ: ベンダー間のプロンプト、レスポンス、トークン、レイテンシー、エラーのログ。

  • ビルトイン ガバナンスとセキュリティ: クラウドまたはオンプレミスにデータを保持するRBAC、監査ログ、およびデプロイオプション。

実験の面では、次のことを意味していました。

  • 評価ハーネスをゲートウェイに一度配線しました。

  • gpt-5.1思考、kimi-k2思考、grok-4.1、双子座3-pro、双子座3-deep thinkをジャストとして登録しました 異なるモデル ID.

  • Swapping between them was a one-line config change, not a new SDK integration.

11. Try Gemini 3 (and the rest) on your own “last exam”

If you’d like to reproduce (or challenge) the patterns in this post:

  1. Pick your exam.

    • Use HLE or an internal “last exam” built from your own domain: research questions, support tickets, code reviews, incident post-mortems.

  2. Run it through multiple models.

    • Point your evaluation harness at the TrueFoundry AI Gateway and run the same prompts across Gemini 3, Kimi-K2 Thinking, Grok-4.1 and GPT-5.1 Thinking.

  3. Compare in one place.

    • Look at correctness, reasoning quality, token usage, latency, and cost side-by-side.

    • Decide which “thinking” model actually earns its grade on your tasks.

Because in 2025, the only benchmark that really matters isn’t HLE, MMLU or GPQA — it’s the exam that looks like your own work. And you don’t have to pick a single model on faith when you can wire up four of them behind one gateway and let the results speak for themselves.

Frequently Asked Questions

What is the difference between Kimi K2 and Gemini 3?

Gemini 3 from Google focuses on multimodal understanding and strong tool-calling capabilities with a Deep Think mode. Kimi-K2 Thinking, an open-weight model, is known for its extensive long context and detailed chain-of-thought reasoning. Understanding kimi k2 vs gemini 3 reveals distinct approaches to advanced AI problem-solving.

What is kimi K2 thinking best for?

Kimi-K2 Thinking is best for complex reasoning and deep problem-solving tasks. With its long context and heavy chain-of-thought by design, **kimi k2** excels at challenges requiring extensive internal monologue, like advanced math problems and benchmarks such as Humanity's Last Exam, often ranking among top models.

Gemini 3 vs GPT-5: which is better?

Our blog delves into Gemini 3 vs GPT-5.1 by assessing their performance on Humanity's Last Exam. We found 'better' depends on the specific reasoning task and model behavior. TrueFoundry's analysis, conducted via our AI Gateway, highlights their unique problem-solving approaches, helping you determine the optimal fit for your AI solutions.

Gemini 3 vs Grok-4: which model performs better?

When comparing Gemini 3 vs Grok-4, both excel as powerful reasoning agents, demonstrating strong performance on complex tasks like Humanity's Last Exam. Gemini 3 features advanced multimodal understanding and a Deep Think mode, while Grok-4 focuses on native tool use and agentic capabilities. Optimal performance often depends on the specific task's requirements.

Which AI model is best for reasoning tasks?

For complex reasoning tasks, models like Gemini 3, Kimi-K2 Thinking, and GPT-5.1 demonstrate strong capabilities. Our blog evaluates how each performs across various challenges, helping you understand their specific strengths. The optimal choice when comparing gemini 3 vs kimi k2 thinking vs gpt 5 ultimately depends on your project's unique demands and the type of reasoning required.

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

Start free
Table of Contents

One Gateway for Every LLM, Agent and MCP Server

Book a 30-min with our AI expert

Book a Demo

The fastest way to build, govern and scale your AI

Book Demo
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Discover More

No items found.
August 17, 2026
|
5 min read

Sandboxed Code Agents: Let Models Execute Without Letting Them Roam

No items found.
Portkey AI Gateway Pricing
August 15, 2026
|
5 min read

2026年版 Portkey AI Gateway 料金:完全ガイドと比較

No items found.
MCP registry connecting agents to governed MCP servers
August 15, 2026
|
5 min read

2026年版 最高のMCPレジストリ:開発者と企業向け比較

No items found.
TrueFoundry AI gateway powers enterprise AI platform engineering at scale
August 15, 2026
|
5 min read

AIプラットフォームエンジニアリングとは?エンタープライズチームのための実践ガイド

No items found.
No items found.

Recent Blogs

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.
Take a quick product tour
Start Product Tour
Product Tour