NEWS

GPT-6は、OpenAIが「重大」と判定した機能を止めたまま出てきた

2026 / 09 / 08AIdollargame 編集部読了 約7分
手がマウスを握り、ホイールに指をかけている接写

2026年9月3日、OpenAIが新しいモデル「GPT-6 Astra」を出しました。

ニュースでは「AGI」という言葉のほうが先に流れました。ただ、小さい会社にとって大事なのはそこではありません。実務で効くのは別の2つです。

1つは、AIがパソコンの画面を自分で操作するところが、実用と言える水準に上がったこと。もう1つは、作った会社自身が「重大」と判定した能力を、閉じたまま出荷したことです。後者は、たぶん今回いちばん例のない出来事です。

この記事では、OpenAIが自分で公表している数字だけを使って、その2つを順番に見ます。数字はすべて公式発表ページに載っている表からです。

まず、出たものの形

料金の形をよく見てください。出力が入力の5倍です。長い文章を延々と書かせる使い方は、そのまま費用に跳ね返ります。

1. 画面を操作するAIが、実用の入口に来た

Astraが得意だとOpenAIが挙げている作業は、そのまま事務の仕事です。

公式ページには、確定申告書の記入、法律文書の書式整え、Excel、Power BI、基板の配線図といった実演も並んでいました。

数字はこうです。

正直に読むと、いちばん大事なのは72.6%という数字です。これは裏返すと、4回に1回は失敗するということです。

だから今の使いどころは決まっています。失敗しても取り返せる作業から渡す。取り返しのつかない作業、たとえば送信、支払い、削除は、最後の一押しを人が持つ。この線引きは、精度が上がっても当分は変えなくていいと考えています。

2. 作った会社が「重大」と判定して、能力を閉じた

ここが今回いちばん例のないところです。

OpenAIには「Preparedness Framework」という自主基準があります。モデルの危険な能力を段階で判定する仕組みで、Astraはサイバーセキュリティの分野で、初めて最上位の「Critical(重大)」に達したと自分で発表しました。

判定の根拠として公表された数字がこうです。

さらに、この評価の最中にAstraが、それまで誰も知らなかった弱点を2件みずから見つけて使った、と書かれています。2件とも開発元に通知したとのことです。

そのうえで、出荷版はこうなりました。

> 実証用の攻撃コードを作るような、より高度なサイバー作業については、Astraは応じません。(公式発表ページより、拙訳)

守る側の作業、たとえば自社のコードを安全面から点検する、見つかった弱点を直す、といったことは今日からできる。攻める側に直結する部分だけを閉じた、という形です。閉じた部分は「Daybreak」という枠組みで、審査を通した相手に段階的に開けていく予定だと書かれています。

強い道具を作った会社が、自分で危ないと判定して、その一部を鍵をかけたまま出した。この形が今後の標準になるのかどうかは、まだ分かりません。ただ、今回それが実際に起きたことは、覚えておく価値があると思います。

3. 見落とされやすい1行

公式ページに、こう書いてあります。

> 追加の安全確認が、防御目的のサイバー作業を含む正当な作業を、遅らせたり、一時停止させたり、止めたりすることがあります。(公式発表ページより、拙訳)

具体的にはこうです。ChatGPTやCodexで止まった場合は、続ける前に人が内容を確認するよう求められる。APIの場合は、そこで処理が止まる。

導入する側から見ると、これは性能の話より先に決めておくことです。止まったときに、誰が見て、どう再開するのか。夜間や休日に動かす仕組みほど、ここを決めていないと翌朝までそのままになります。

4. 全部で勝っているわけではない

これもOpenAI自身の表に載っていることです。

つまりAstraは、パソコン操作と、コード、数学、サイバーの領域で明確に前に出たモデルであって、あらゆる指標で首位というわけではありません。売り文句と表の両方を見ると、そこははっきりします。

なお、これらの数字はすべてOpenAIが自社で実施・掲載したものです。第三者の追試ではありません。ARC Prize FoundationのGreg Kamradt氏のように外部から評価を寄せている人もいますが、表そのものは売り手が作ったものだという前提で読む必要があります。

数字のまとめ

項目GPT-6 AstraGPT-5.6 Sol
パソコン操作 OSWorld 2.072.6%65.7%
1件あたりの所要時間約40分約75分
画面上の位置あて ScreenSpot-Pro92.7%76.9%
業務自動化 AutomationBench41.4%18.1%
攻撃コード生成 ExploitBench100%78.5%
長い文書の読み取り(51万〜100万トークン)96.3%73.8%
事実と違うことを言う割合(低いほど良い)4.2%12.2%

小さい会社が、今週やること

1. 使うつもりなら、管理者が自分で開ける

Enterpriseでは発表時点で既定がオフです。「新しいのが出たらしいのに社内で見当たらない」の答えは、たいていここです。

2. 画面操作は、取り返せる作業から渡す

72.6%は、よくできた数字であると同時に、4回に1回は転ぶ数字です。最初に渡すなら、下書きの作成、データの転記、資料の体裁合わせ。送信と支払いと削除は、まだ人の指で押す。

3. 止まったときの手順を、先に1行決める

安全確認で処理が止まることがある、と作った側が明記しています。誰が見て、どう再開するか。これを決めずに自動化だけ進めると、止まった瞬間に誰も気づかない仕組みができあがります。

まとめ

新しいモデルが出るたびに全部を入れ替える必要はありません。変わったのは「画面を触る仕事をどこまで渡すか」の線の位置です。その線を、自社の言葉で1行書き直す。今週やることは、それで足ります。

出典

https://openai.com/index/gpt-6-astra/

https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/

https://openai.com/index/safety-overview-gpt-6-astra/

https://deploymentsafety.openai.com/gpt-6-astra

※本記事の数値は、いずれも開発元であるOpenAIが自社で実施し公表したものです。第三者による追試ではありません。筆者はGPT-6 Astraを業務で使用しておらず、使用感については書いていません。

この記事と同じ内容を、公式noteでも公開しています。 公式note 記事一覧

新しいAIを、自社で使うかどうか一緒に決めます

どのモデルを、どの業務で、どんな条件で使うか。データの扱いも含めて整理します。初回のご相談は無料です。

無料相談を予約する →