GPT
履歴を開く現行モデル
公式モデル一覧- GPT-6 Astra
- GPT-6.1 Sol
- GPT-6 Luna
- GPT-Image-2.5 Sunburst
- GPT-Image-2.5 Flare
- GPT-Live 1
- GPT-Realtime-2.1
- GPT-Realtime-2.1 Mini
- GPT-Realtime-2
- GPT-Realtime-Translate
- GPT-Realtime-1.5
- GPT-4o Mini TTS
- GPT-Transcribe
- GPT-Live-Transcribe
- GPT-Realtime-Whisper
- GPT-4o Transcribe
- GPT-4o Mini Transcribe
- text-embedding-3-small
- text-embedding-3-large
- GPT-5.6 Cyber / Daybreak Red利用制限あり
- GPT-Rosalind利用制限あり
GPT-6.1 Sol
OpenAI が Sol を更新。コーディング、文書理解、コンピューター操作を対象にします。
- ChatGPT Work、Codex、API で提供。Chat にはまだ導入されていません。
発表時の利用条件
公開時のChatGPT WorkとCodexはPlus・Pro・Business・Enterprise・Edu向けです。公式評価はタスクと推論設定に依存します。
発表と評価の資料
13 件の資料発表時の ChatGPT Work と Codex における Plus・Pro・Business・Enterprise・Edu の利用対象を記載しています。
現在の評価表
Intelligence Index v4.3.2 の確認時データ。旧手法のスコアとは直接比較できません。
データを見る更新日は未記載
更新日は未記載
| Claude Opus 5.5max with fallback | 58 |
|---|---|
| Claude Sonnet 5.5max with fallback | 56 |
| GPT-6 Astramax | 53 |
| Gemini 4 Argonhigh | 53 |
| GPT-6.1 Solmax | 52 |
| Qwen3.8 Max (0902) | 45 |
| Muse Spark 1.3max | 48 |
| GLM-5.3max | 45 |
| GLM-5.3low | 34 |
| GLM-5.3-Flash | 42 |
テキストの選好スコア。暫定判定と不確実性を保持し、同一ランキング内で比較してください。
データを見る2026年10月2日
データ更新 ·
| Gemini 4 Argonhigh; preliminary | 1525±9 |
|---|---|
| Claude Opus 5.5high | 1504±9 |
| Claude Fable 5.1max | 1501±6 |
| Gemini 3.8 Flashhigh; preliminary | 1495±5 |
| Muse Spark 1.3max | 1494±6 |
WebDev の選好スコア。暫定判定と不確実性を保持し、同一ランキング内で比較してください。
データを見る2026年10月1日
データ更新 ·
| Claude Opus 5.5max | 1815+16/-16 |
|---|---|
| Claude Sonnet 5.5xhigh | 1786+18/-18 |
| GPT-6.1 Solmax | 1758+17/-17 |
| Gemini 4 Argonhigh; preliminary | 1680+13/-13 |
| Qwen3.8 Max (0902)preliminary | 1670+8/-8 |
Agent Arena の Net Improvement 指標です。タスク成功率ではなく、記載した設定に対応します。
データを見る2026年10月2日
データ更新 ·
| Claude Fable 5.1max | 14.31%±1.90% |
|---|---|
| Claude Opus 5.5high | 13.82%±2.17% |
| Claude Sonnet 5.5max | 12.52%±3.09% |
| GPT-6 Astramax | 12.27%±2.23% |
| GPT-6.1 Solmax | 11.23%±2.76% |
TH1.1 のタスク完了時間。モデル別のグラフ値は未確認のため、数値を掲載しません。
データ更新 ·
テキストから画像生成の選好スコア。暫定判定と生成設定を保持します。
データを見る2026年9月24日
データ更新 ·
| gpt-image-2.5-sunburstPreliminary | 1424 ±8 |
|---|---|
| gpt-image-2.5-flarePreliminary | 1401 ±8 |
| muse-image | 1276 ±5 |
| gemini-3.1-flash-imagenano-banana-2; web-search | 1261 ±4 |
| seedream-5.0-pro | 1256 ±4 |
| qwen-image-3.0-pro | 1256 ±6 |
| qwen-image-2.1Preliminary | 1228 ±9 |
| flux-2-max | 1162 ±3 |
各社の音声を使うブラインド聴取の選好評価。統一音声や遅延の比較ではありません。
データを見る更新日は未記載
更新日は未記載
| Eleven v495% CI1303–1339;1930samples;8nativevoices | 1321 ±18 |
|---|---|
| Qwen-Audio-3.1-TTS-Plus95% CI1274–1310;1481samples;8nativevoices | 1292 ±18 |
| Gemini3.8 Flash TTS95% CI1259–1291;2446samples;8nativevoices | 1275 ±16 |
| MiniMax Speech2.8 HD95% CI1162–1184;4638samples;8nativevoices | 1173 ±11 |
モデル群の資料4
モデル群や過去のバージョンを扱う資料です。今回の発表を評価したものではありません。
GPT-5.5を5種類の推論設定で評価した過去のテストです。GPT-6.1 Solの評価ではなく、結果は指標と設定に依存します。
gpt-5-thinkingの過去のソフトウェア課題・一部リスクの評価。公開前のNDAアクセスと公開承認の条件を明記し、GPT-6には外挿できません。