OpenAIの「GPT-6 Astra」が筆者の環境で使えるようになり、創作課題で試されました。
推論ベンチマークで、前世代の「GPT-5.5 Sol」比12倍との報告も紹介されています。
短編小説やゲーム制作では、具体的なフィードバックの与え方が結果を左右したとしています。
記事の概要
GPT-6 Astraは、汎用性と性能の高さを備えたモデルとして紹介されています。
一方で、短編小説や簡単なゲーム制作では、性能差を体感しにくくなっているとしています。
筆者が作成した短編小説「エンドロールのあとで」は、調整後も標準的な印象にとどまりました。
シンプルな指示で作った2Dシューティングゲームは、約20分で完成しました。
そのゲームは、以前のGPT-5.5製ゲームを上回る一方、Anthropicの「Claude Fable 5」製ゲームには面白さで劣ったと評価されています。
そこで月面の敵基地への侵攻や、巨大戦艦の部品を順番に破壊する展開を追加で指示しました。
約1時間の調整後に完成した「NeonSwarm」は、敵の強さなどに課題を残しながらも、面白さが大きく向上しました。
記事のポイント
- 評価課題が難化: 短編小説や簡単なゲームは容易に作れるため、モデル間の性能差を測る課題として難しくなっています。
- 具体指示で改善: 月面侵攻や巨大戦艦の破壊手順など、展開を具体化する指示でゲームの内容が改善しました。
- 調整には約1時間: 完成後も敵の強さや弾幕には調整の余地があり、狙いを伝える反復作業が必要でした。
このニュースがもたらす影響
- 導入を検討する企業: 試作物を短時間で作れることだけでは導入効果を測りにくくなり、具体的な業務目標や評価基準を定めて、反復調整まで含む運用を検討する必要がありそうです。
- AI開発企業: モデル性能の訴求では、単純な生成結果やベンチマークだけで差を示しにくくなり、複雑な指示への追従性や改善に要する対話回数が競争軸になる可能性があります。
- 制作部門: AIに完成品を一度で作らせる発想から、狙う展開や仕様を具体化して段階的に改善する進め方へ、企画・ディレクションの役割が移ると考えられます。
このニュースの背景
GPT-6 Astraは、前世代モデルを大きく上回る推論性能と汎用性を備えたモデルとして紹介されています。
一方で、短編小説や簡単なゲームは容易に作れるため、従来の作例だけではモデル間の性能差を測りにくくなっています。
実際のゲーム制作では、月面侵攻や巨大戦艦の破壊手順など具体的な指示を加え、約1時間の調整を重ねることで内容が改善しました。
関連するニュース
- OpenAIがGPT-6 Astraを発表し、未知環境を攻略するARC-AGI-3で99.9%を記録しました。
- OpenAIはGPT‑6 Astraを発表し、ブラウザ操作や科学研究などの業務代行機能を一部組織向けに提供開始しました。
- OpenAIは高性能とサイバー攻撃能力を併せ持つGPT-6 Astraの提供を始めました。
詳しい記事の内容はこちらから(引用元)
GPT-6 Astraで2Dゲームや学校の3D空間、馬のアニメーションを短時間で制作した。試行と専門家のフィードバックを…
https://ascii.jp/elem/000/004/434/4434403/