Gemini 3 Pro Bot【ベータ版】をリリースしました。
Google史上最強のLLM です。Gemini 3 Proは主要ベンチマークで圧倒的なスコアを記録!
主要ベンチマーク結果
業界で広く使用されているベンチマークでの成績を分野別に見ていきます。
推論・知識系
複雑な推論と深い知識が必要なタスクでの成績です。
GPQA Diamond(大学院レベルの科学問題)
- スコア: 91.9%
- 物理学、化学、生物学の大学院レベルの問題を解く能力を測定
- 専門家でも難しいとされる問題で、非常に高い正解率を達成
Humanity’s Last Exam(超難問試験)
- スコア: 37.5%(ツールなし)
- GPT-5.1は26.5%、11ポイント差をつけてトップ
- 100以上の科目にわたる2,500の難問で構成される試験
- 博士レベルの推論能力を持つことを証明
数学・コーディング系
開発者にとって特に重要な、数学とプログラミング能力の評価です。
AIME 2025(数学)
- スコア: 95%(ツールなし)、100%(ツールあり)
- アメリカ数学オリンピックの予選問題レベル
- ツール使用時は完全正解という驚異的な成績
SWE-bench Verified(コーディング)
- スコア: 76.2%
- 実際のGitHubのissueを解決する能力を測定
- コーディングエージェントとしての実力を証明
- Gemini 2.5 Proから大幅に改善
実用系
実際のビジネスや日常的な使用での性能を測る指標です。
SimpleQA Verified(事実確認)
- スコア: 72.1%
- 競合モデルより約40%高い正確性
- シンプルな事実確認質問に対する正確な回答能力
- 幻覚(ハルシネーション)の発生率が大幅に低い
- Googleは「最も事実に忠実なモデル」と表現
Vending-Bench 2(ビジネス収益性)
- スコア: 約$5.5k
- Claude Sonnet 4.5は約$3.8k
- AIモデルがシミュレーション上で長期的に利益を生むビジネスを運営できるかを測定
- 実用的なビジネス判断能力の高さを示す
Terminal-Bench 2.0(ツール使用)
- スコア: 54.2%
- ターミナル経由でコンピュータを操作する能力を測定
- エージェント機能の実用性を証明
Share
What's Your Reaction?
Like
0
Dislike
0
Love
0
Funny
0
Angry
0
Sad
0
Wow
0