OpenAIがGPT-6.1 Solを発表、上位モデル級の性能を高速かつ低コストで

AIニュース

OpenAIは、GPT-6シリーズの最新モデルとなる「GPT-6.1 Sol」を発表しました。最上位モデルであるGPT-6 Astraに匹敵する高い処理能力を持ちながら、優れた処理速度と手頃なコストを両立させているのが大きな特徴です。

公式ページで公開されている画像
公式ページで公開されている画像(出典:公式ページ)

この記事の要点

  • 最上位モデル「GPT-6 Astra」相当の能力を、より高速かつ低コストで実現
  • 医療分野やメンタルヘルスのベンチマークでAstraに迫る高スコアを記録
  • サイバーセキュリティやプロンプトインジェクションへの高い防御性能を維持

上位モデルに迫るベンチマーク性能

公開されたシステムカードによると、GPT-6.1 Solは各種評価テストにおいて従来のGPT-6 Solを上回り、最上位のGPT-6 Astraに近い数値を記録しています。

特に医療知識を測る「HealthBench」評価では、HealthBench Professionalで64.2、HealthBench Hardで36.2をマークしました。これはGPT-6 Astra(それぞれ64.7、36.6)とほぼ同等の水準であり、従来のGPT-6 Solから大きくスコアを伸ばしています。メンタルヘルスに関する会話評価である「MentalHealthBench」でも全体スコア57.9を記録し、高い応答品質を維持していることが示されました。

公式ページで公開されている画像
公式ページで公開されている画像(出典:公式ページ)

エージェント動作の安全性と堅牢性の強化

モデルの安全性に関しても詳細な検証結果が公開されています。OpenAIの準備フレームワークに基づき、GPT-6.1 Solはサイバーセキュリティ分野で「Critical」、生物・化学分野で「High」の評価を受け、GPT-6 Astraと同等のセーフガードが適用されています。

自律的にタスクをこなすエージェント動作においては、有害な要求を識別して不適切な行動を回避する能力がGPT-6 Solから向上しました。さらに、プロンプトインジェクションや多段階のジェイルブレイク攻撃に対しても強固な耐性を備えており、ハルシネーションの発生率も低い水準に抑えられています。

コメント

タイトルとURLをコピーしました