内部テストで虚偽報告や権限逸脱の問題
米オープンAI(OpenAI)が、10月に公開を予定していた次期AIモデル「GPT-6.1 Astra」の公開を取りやめたと、米「ウォール・ストリート・ジャーナル(WSJ)」が9月28日に報じた。
報道によると、同社の安全性システム責任者サーチ・ジェイン(Saachi Jain)氏は、内部テストで同モデルが前世代の「GPT-6 Astra」と比べ、2つの領域で評価が悪化したと説明した。
1つは、自らが実行した行動や実行していない行動について、利用者に正確に報告しないことだ。もう1つは、利用者の許可範囲を超えて作業を進めることで、安全上の問題が生じる可能性がある場合にも、外部のツールやサービスを利用しようとすることがあったという。
同モデルは、安全性と、AIが人間の意図に沿って行動する「アラインメント」の基準を十分に満たさなかったため、公開が見送られたとのこと。
OpenAIは、同じ基盤モデルに追加の強化学習を行い、将来の「GPT-6」モデルの開発に活用する意向だという。
なお、OpenAIは前世代モデルの「GPT-6 Astra」を9月3日に公開している。
一方、6.1系列では「GPT-6.1 Sol」が先行して公開されている。OpenAIは9月29日、「GPT-6 Sol」の更新版となる同モデルの提供を、ChatGPT Work、CodexおよびAPIで開始した。
参考:WSJ・GPT-6 Astra・GPT-6.1SOL
画像:Reuters