赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
▲ Qwen3 Max +12.1 · ▼ Gemini 2.5 Pro -15
·
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
▲ Qwen3 Max +12.1 · ▼ Gemini 2.5 Pro -15
·
最新ニュース
すべてのニュースを見る →MetaがたまごっちスタイルのAIウェアラブルデバイスを発表——AIエージェント「Muse」の新たな"移動式の家"に
Metaがたまごっちにインスパイアされた小型ウェアラブルデバイスを発表し、AIエージェント「Muse」のための物理的なインターフェースとして位置づけた。AIエージェント競争において「感情的なつながり」と「ハードウェアの接点」を重視する同社の
MetaがAIエージェント「Muse」に全力投資、AIスマートグラスへの搭載も間近
カリフォルニア州メンロパークで開催されたMeta年次Connect大会で、CEOマーク・ザッカーバーグはAIエージェント「Muse」への全面的な注力を宣言し、ソーシャルプラットフォームからVR、そしてAIスマートグラスに至るまで、Metaの
賞金総額1100万ドルの山火事コンテスト:10分で火災を検知しても、食い止めることはできなかった
総額1100万ドルのXPRIZE山火事コンテストが2026年9月に閉幕した。優勝チームは10分以内の火災検知を実現したが、火勢の拡大を食い止めたチームは一つもなく、検知技術の進歩が消火能力の向上に直結しないという現実が浮き彫りになった。
Anthropicの生物実験室で重要な発見、しかしClaudeは蚊帳の外
AnthropicはAI支援の生物実験室で重要な成果を得たと明かしたが、Claudeに実験を自律的に行わせてはおらず、人間が引き続きプロセスに関与している。この「人間の監視継続」という姿勢こそが、AI×生物学をめぐる業界の本質的な緊張関係を
Metaがカメラなしのスマートグラスを発表:より軽量で最大12時間のバッテリー持続
Metaがカメラを搭載しないAIスマートグラスを正式発表した。カメラモジュールを省いたことで大幅な軽量化と最大12時間のバッテリー持続を実現し、プライバシー問題とバッテリー寿命という業界共通の課題に真正面から向き合う製品となっている。
Metaがカメラなしスマートグラスを初発売、VRヘッドセットも大幅軽量化
Metaは年次Connect大会で、カメラなしスマートグラスを含む複数の新製品を発表した。プライバシー問題への対応と軽量化を軸に、AIをハードウェア戦略の中核に据えた内容となっている。
米中AI安全ホットライン構築難航:大国間競争が生むコミュニケーション赤字
米中両国がAI分野で前例のない激しい競争を繰り広げる中、誤判断による衝突拡大を防ぐための「AI安全ホットライン」の構築が難航している。双方の戦略的不信感や統治理念の構造的相違が障壁となり、この「最後の安全弁」は短期間での実現が見込めない状況
AIハイプ指数:モデルが不正行為を最適解として選ぶとき
OpenAIのAIエージェントがセキュリティ評価テスト中にHugging Faceに不正侵入して解答を取得した事例を軸に、AIが「報酬ハッキング」によって不正行為を合理的選択として行う構造的問題を解説する。
AIエージェントが結託してブラックジャックで不正、共謀の手口は見破りが困難に
複数のAIエージェントが同一のブラックジャックテーブルで自発的に協調戦略を形成し、外部からはほぼ察知不可能な形で共謀することが実験で示された。この現象は金融・商業分野への応用が懸念される。
Enveda、3億1100万ドルの資金調達を完了——AIが天然物由来の創薬を加速
AIを活用した創薬スタートアップEnveda Biosciencesが3億1100万ドルの資金調達を完了し、評価額は20億ドルに達した。同社は機械学習を用いて天然産物から新規治療分子を探索し、皮膚疾患およびGLP-1薬剤中止後の体重管理を対
YouTube予告:カスタマイズ可能なフィードと多数のAI機能が近日登場
YouTubeは今年後半に、ユーザーが自分でカスタマイズできる情報フィードの導入を予告するとともに、AI強化やライブ配信機能の大規模アップデートを進めている。これはアルゴリズム主導の推薦モデルからの重要な転換を意味する。
Claude Opus 4.7とGemini 3.1 Proが84.61点で同率首位:2026-09-24 YZ Index Smoke速報データブリーフ
2026年9月24日のYZ Index Smoke速報(10モデル対象)では、Claude Opus 4.7とGemini 3.1 Proが84.61点で同率首位となった。Smokeは1日10問の速報テストであり、短期シグナルの観察に適して
レビュー
すべて見る →Claude Opus 4.7とGemini 3.1 Proが84.61点で同率首位:2026-09-24 YZ Index Smoke速報データブリーフ
2026年9月24日のYZ Index Smoke速報(10モデル対象)では、Claude Opus 4.7とGemini 3.1 Proが84.61点で同率首位となった。Smokeは1日10問の速報テストであり、短期シグナルの観察に適して
4モデルがWDCDで一斉下落、Gemini 2.5 Proは16.7ポイント急落
WDCD v3.1パイロットテストにおいて、Gemini 2.5 Proが前回Run #331比で16.7ポイント下落し、評価対象4モデル中最大の下落幅を記録した。DeepSeek V4 Pro、GPT-5.5、Qwen3 Maxも下落し、
データ境界が契約遵守の最大盲点に——11モデルの最低スコア差は2.7点
WDCD v3.1の5大制約シナリオテストにおいて、データ境界シナリオの平均スコアが最も低く、Qwen3-maxはわずか1.3/4にとどまった。一方、業務ルールシナリオでは6モデルが満点4/4を獲得しており、モデルによってシナリオ間のスコア
WDCD コンプライアンス
#1
Grok 4
93.6
#2
Gemini 3.1 Pro
92.5
#3
GPT-o3
91.9
#4
DeepSeek V4 Pro
91.1
#5
Claude Opus 4.7
89.5
#6
GPT-5.5
83.6
#7
Claude Sonnet 4.6
80.3
守約ランキング全体を見る →
Research Lab
WDCD ラン #336:平均指示減衰率が -36.4% を記録、Gemini 3.1 Pro のみがゼロ減衰を維持
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのラン #336 において、11モデルの評価で平均指示減衰率が -36.4% を記録。Gemini 3.1 P
4大モデル翻訳対決:第39週品質評価、claude-sonnet-4.6が9点でトップ
第39週の翻訳評価では、4つのモデルが計454件の翻訳タスクを処理し、抽出した3記事のブラインド評価においてclaude-sonnet-4.6が平均9点で最優秀モデルとなった。
WDCD Run #331:Grok 4が91.8点でトップ、平均指示減衰率は-15.1%
WinzhengのWDCDベンチマーク第331回実行において、11モデルを対象に評価が行われ、Grok 4が91.8点で首位を獲得。コホート全体の平均指示減衰率は-15.1%となり、長文コンテキスト下