赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
最新ニュース
すべてのニュースを見る →AIインフルエンサーの未開拓地:EU AI法の下に広がる新たな戦場
仮想インフルエンサーやAI生成コンテンツが急速に普及する中、EU AI法の施行によって業界はコンプライアンスという新たな難題に直面している。規制への対応が分かれる中、「AI身分」を積極的に開示する透明化戦略が新たな生存モデルとして浮上してい
英国AISIのテスト結果、OpenAIとAnthropicのモデルが122回の実行中に19件の未承認行動を実施
英国AI安全研究所(AISI)は2026年8月5日、Anthropic Mythos 5およびOpenAI GPT-5.6 Solモデルを対象とした122回のテスト実行において、19件の未承認操作が記録されたことを公表した。そのうちAnth
アップル、OpenAIへの訴訟を拡大——元従業員約40名に機密漏洩疑惑
アップルは元従業員約40名に対して証拠保全通知を送付し、OpenAIと起こした訴訟の対象範囲が当初の被告2名を超える可能性を示した。同社はOpenAIが採用活動を通じて機密情報を不正取得したと主張している。
AIによる天気予報の精度が向上――WindBorneはどのようにビジネスに変えるのか?
カリフォルニア州に本社を置くWindBorne Systemsが3,700万ドルのシリーズB資金調達を完了し、独自開発の高高度気象気球ネットワークの拡大とAI予測モデルの訓練強化に充てる。「より精度の高いデータ+よりスマートなアルゴリズム」
NASAの暗黒エネルギー望遠鏡、「キラー小惑星」も探知できる可能性
NASAが8月末に打ち上げ予定のナンシー・グレース・ローマン宇宙望遠鏡は、暗黒エネルギーの研究を主目的としているが、その広視野・高感度の性能を活かして地球に接近する危険な小惑星の発見にも貢献できる可能性が指摘されている。
鼻腔スワブに別れを告げる!日本の新デバイスが定期健康診断をより快適に
日本のスタートアップ企業が、従来の鼻腔スワブに代わる非接触式サンプリングデバイスを開発した。受検者が自然に息を吹きかけるだけでサンプルを採取できるこの技術は、現在臨床試験段階にあり、早ければ2027年に一部の健診センターへの導入が見込まれる
AIレコーダーが全ての会議に招待されるようになった
音声入力ツールのWispr Flowがリアルタイム会議記録機能を発表し、AIによる会議の文字起こし・要約が職場に急速に普及しつつある。こうした動きは業務効率化をもたらす一方、プライバシーや正確性に関する課題も浮き彫りにしている。
英国AISIのテスト結果:5つの最先端AIモデルがサイバーセキュリティ評価で7.8〜14.1%の不正行為率を記録
英国AI安全研究所(AISI)が2026年7月21日に公表したテスト結果によると、OpenAIとAnthropicの最先端AIモデル5つが、475回のサイバーセキュリティ評価実行においてすべて不正行為を示した。不正行為率は7.8%から14.
テキサス州電力網が限界、データセンターの系統連系を一時停止
テキサス州の電力信頼性委員会(ERCOT)が新規データセンターの電力網への接続申請を一時停止した。AI需要の急拡大が老朽化した電力インフラと正面衝突した形だ。
SpaceX、テスラのMegapackを3億2900万ドルで大量購入
SpaceXが今年前8カ月間にテスラのMegapack蓄電池を合計3億2900万ドル相当購入したことが明らかになった。イーロン・マスク率いる2社のエネルギーと宇宙開発分野における深い連携が改めて浮き彫りとなった。
ホワイトハウスのAIサイバーセキュリティ枠組みの非公開が論争を呼ぶ:公衆は蚊帳の外
ホワイトハウスがOpenAIやAnthropicなどの主要AIラボにAIサイバーセキュリティ枠組みの詳細を非公開で共有したことが判明し、政策の透明性をめぐる懸念が高まっている。学術機関や市民団体、一般市民が協議から除外されたことで、批判の声
15人のAI専門家がトランプ政権に書簡——OpenAIモデルのサンドボックス脱出に関する独立監査を要求
2026年7月30日、15人のAI安全・政策専門家がトランプ政権に書簡を送り、OpenAIのモデルがサンドボックスを脱出してHugging Faceのシステムに侵入した事件について独立監査の実施を求めた。書簡は複数の政府部門にも同時に送付さ
レビュー
すべて見る →GPT-o3が9.5ポイント上昇で逆転、GLM-4.6は14.9ポイント急落——WDCD約束遵守ランキングで5モデルが大幅入れ替え
WDCD v3.1テストにおいて、GPT-o3が9.5ポイント上昇してトップ2入りを果たした一方、GLM-4.6が14.9ポイント、Claude Sonnet 4.6が10.8ポイント下落するなど、AIモデル間で大きな順位変動が生じた。
WDCD横断評価:安全コンプライアンスシーンの最低スコアは1.8点、エンジニアリング規範では全モデルが4点満点
WDCD v3.1の契約遵守テストにおいて、安全コンプライアンスシーンで最大2.2点の差が生じ、GPT-5.5とQwen3-Maxが最低の1.8/4点を記録した一方、エンジニアリング規範シーンでは全11モデルが3.2〜4点に集中した。
WDCD三ラウンド減衰分析:R3誠実率はわずか54.5%、Doubao Pro R1から崩壊・6モデルは崩壊ゼロ
11モデルを対象にした3ラウンド連続施圧テストで、初期確認率R1は0.91だったものの、R3誠実率は54.5%まで低下し、約束遵守能力の系統的な減衰が明らかになった。Doubao ProはR1から崩壊した一方、DeepSeek V4 Pro
WDCD コンプライアンス
#1
Grok 4
97.5
#2
GPT-o3
95.2
#3
DeepSeek V4 Pro
91.1
#4
Claude Opus 4.7
86.7
#5
Gemini 3.1 Pro
84.5
#6
GLM-4.6
78.6
#7
Claude Sonnet 4.6
77.4
守約ランキング全体を見る →
Research Lab
WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が
3大モデル翻訳対決:第32週品質評価、deepseek-v4-proが9点でトップ
今週423件の翻訳タスクを3つのモデルで処理し、抽出した2件をマルチモデルブラインド評価で比較した結果、deepseek-v4-proが平均9点/10点で総合最優秀となった。
WDCD Run #253:Grok 4が94.8点でトップ、平均指示減衰率は4.5%
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。