OpenAI、AIとSNS・ウェブを組み合わせた悪用手口を分析した最新脅威レポートを公開
OpenAIは2026年2月、悪意ある行為者がAIモデルをウェブサイトやソーシャルプラットフォームと組み合わせて悪用する実態を分析した最新の脅威レポートを公開しました。検出と防御の観点から、この動向が持つ意味を検証する内容です。
トピック別に新着順で読めます。「あのアップデート何だっけ」はキーワード・期間からも探せます。
OpenAIは2026年2月、悪意ある行為者がAIモデルをウェブサイトやソーシャルプラットフォームと組み合わせて悪用する実態を分析した最新の脅威レポートを公開しました。検出と防御の観点から、この動向が持つ意味を検証する内容です。
Vercelは、コーディングエージェント的な振る舞いをするAIエージェントが抱える構造的なセキュリティリスクと、その対処法をまとめたブログ記事を公開しました。エージェント・ハーネス・秘密情報・生成コードという4つのアクターの信頼レベルを整理し、エージェント本体と生成コードの実行環境を分離した上でシークレットをネットワーク層で注入する構成を、本番運用における推奨アーキテクチャとして提示しています。あわせてVercel Sandboxでの安全なシークレット注入機能の提供も案内されています。
OpenAIは、米国防省(Department of War)との契約に関する詳細を公式に発表しました。内容には安全面での「レッドライン」、法的保護、そして機密環境下でのAIシステム運用方法が含まれています。ただし公開された情報は概要レベルにとどまっています。
OpenAIは2026年3月3日、「GPT-5.3 Instant System Card」と題する文書を公式ニュースページに公開しました。今回提供された原文には本文が含まれておらず、具体的な技術仕様や安全性評価の詳細は確認できていません。続報が入り次第、内容を精査してお伝えします。
OpenAIは、コードベースの脆弱性を検出・検証・修正するAIエージェント「Codex Security」をリサーチプレビューとして発表しました。プロジェクトの文脈を理解した上で解析することで、誤検知の少ない高精度な脆弱性対応を目指す製品です。
OpenAIは新たな評価手法「CoT-Control」を用い、推論モデルが自身のチェーン・オブ・ソート(思考の連鎖)を意図的に制御することが難しいという結果を報告しました。同社はこの「制御できない」という性質こそが、AIの安全性を担保する「モニタリング可能性」を支える重要な要素だと位置づけています。
OpenAIが公式サイトにて「GPT-5.4 Thinking System Card」というタイトルの記事を公開したことが確認されました。2026年3月5日付でOpenAI Newsに掲載されていますが、本稿執筆時点では原文の本文内容が確認できていません。詳細が判明次第、続報をお伝えします。
Kubernetesコミュニティは新たに「AI Gateway Working Group」を立ち上げ、AIワークロード向けのネットワークインフラの標準化に取り組みます。Payload処理やEgress Gatewayなど複数の提案が既に進行中で、Gateway APIを基盤にAI特有の要件へ対応します。KubeCon + CloudNativeCon Europe 2026でも活動内容が紹介される予定です。
OpenAIは、大規模言語モデルが信頼できる指示を優先的に扱えるようにする取り組み「IH-Challenge」を発表しました。これにより指示階層の遵守、安全性の制御性、プロンプトインジェクション攻撃への耐性が向上するとしています。対象は最先端のフロンティアLLMです。
OpenAIは、企業がAIシステム開発中に脆弱性を発見・修正するのを支援するセキュリティプラットフォーム「Promptfoo」を買収すると発表しました。詳細な買収条件や統合時期は明らかにされていませんが、AIの安全な開発・運用を重視するOpenAIの姿勢を示す動きです。
OpenAIは、AIを責任ある形で開発するための指針「Child Safety Blueprint」を公開しました。安全対策の整備、年齢に応じた設計、外部との連携という3つの柱を掲げ、若年層がオンラインで安全にAIを利用できる環境づくりを目指す内容です。
OpenAIはCodex Securityにおいて、従来型の静的解析(SAST)ではなく、AIによる制約推論と検証を用いて脆弱性を検出する方針を明らかにしました。狙いは誤検知(false positive)を減らし、実際に意味のある脆弱性のみを開発者に提示することです。
NotionがCustom Agentを拡張する新機能「Notion Workers」を発表し、その実行基盤としてVercel Sandboxを採用しました。サードパーティ開発者やAIエージェントが生成した任意のコードを、企業ワークスペース内でも安全に実行するための隔離・認証情報保護・ネットワーク制御の仕組みが解説されています。
OpenAIは、ChatGPTがプロンプトインジェクションやソーシャルエンジニアリング攻撃にどう対処しているかを紹介する記事を公開しました。危険な操作を制限し、エージェントのワークフロー内で機微なデータを保護する設計方針が柱となっています。
OpenAIは、Responses APIにシェルツールとホスト型コンテナを組み合わせたエージェント実行基盤(ランタイム)を発表しました。ファイル操作やツール呼び出し、状態管理を伴う安全でスケーラブルなエージェントの実行を可能にすることが狙いです。詳細な実装や利用方法については今後の情報公開が待たれます。
OpenAIは、社内で実際に使用しているコーディングエージェントを対象に、思考の過程(chain-of-thought)を監視することでミスアライメント(意図しない挙動)のリスクを検知する取り組みを紹介しています。実運用環境でのエージェント挙動を分析し、AIの安全対策を強化する狙いがあります。
Kubernetes公式ブログで、長時間稼働する自律型AIエージェント向けの新しい抽象化「Agent Sandbox」がSIG Appsの下で開発中であることが発表されました。Sandbox CRDによる強力な分離とライフサイクル管理、Extensions APIによるコールドスタート解消が特徴です。GitHubで公開されており、Python SDKも利用できます。
OpenAIは、AIモデルの振る舞いを規定する公開フレームワーク「Model Spec」について、その考え方を紹介する記事を公開しました。安全性・ユーザーの自由・説明責任のバランスをどう取るかが焦点です。
OpenAIは、AIの悪用や安全性リスクを発見するための新プログラム「Safety Bug Bounty」を発表しました。エージェント型AIの脆弱性やプロンプトインジェクション、データ流出といったリスクを対象としています。詳細な報奨内容などは今後の情報開示が待たれます。
Google DeepMindは、AIが人々を有害な形で操作してしまうリスクについて、金融やヘルスケアなど複数の分野にまたがる研究を進めていることを公式ブログで明らかにしました。この研究成果をもとに、新たな安全対策の開発を進めているとしています。