Gemini 3 Pro Bot【ベータ版】をリリースしました。

Google史上最強のLLM です。Gemini 3 Proは主要ベンチマークで圧倒的なスコアを記録!

Gemini 3 Pro Bot【ベータ版】をリリースしました。

主要ベンチマーク結果

業界で広く使用されているベンチマークでの成績を分野別に見ていきます。

推論・知識系

複雑な推論と深い知識が必要なタスクでの成績です。

GPQA Diamond(大学院レベルの科学問題)

  • スコア: 91.9%
  • 物理学、化学、生物学の大学院レベルの問題を解く能力を測定
  • 専門家でも難しいとされる問題で、非常に高い正解率を達成

Humanity’s Last Exam(超難問試験)

  • スコア: 37.5%(ツールなし)
  • GPT-5.1は26.5%、11ポイント差をつけてトップ
  • 100以上の科目にわたる2,500の難問で構成される試験
  • 博士レベルの推論能力を持つことを証明

数学・コーディング系

開発者にとって特に重要な、数学とプログラミング能力の評価です。

AIME 2025(数学)

  • スコア: 95%(ツールなし)、100%(ツールあり)
  • アメリカ数学オリンピックの予選問題レベル
  • ツール使用時は完全正解という驚異的な成績

SWE-bench Verified(コーディング)

  • スコア: 76.2%
  • 実際のGitHubのissueを解決する能力を測定
  • コーディングエージェントとしての実力を証明
  • Gemini 2.5 Proから大幅に改善

実用系

実際のビジネスや日常的な使用での性能を測る指標です。

SimpleQA Verified(事実確認)

  • スコア: 72.1%
  • 競合モデルより約40%高い正確性
  • シンプルな事実確認質問に対する正確な回答能力
  • 幻覚(ハルシネーション)の発生率が大幅に低い
  • Googleは「最も事実に忠実なモデル」と表現

Vending-Bench 2(ビジネス収益性)

  • スコア: 約$5.5k
  • Claude Sonnet 4.5は約$3.8k
  • AIモデルがシミュレーション上で長期的に利益を生むビジネスを運営できるかを測定
  • 実用的なビジネス判断能力の高さを示す

Terminal-Bench 2.0(ツール使用)

  • スコア: 54.2%
  • ターミナル経由でコンピュータを操作する能力を測定
  • エージェント機能の実用性を証明

Share

What's Your Reaction?

Like Like 0
Dislike Dislike 0
Love Love 0
Funny Funny 0
Angry Angry 0
Sad Sad 0
Wow Wow 0