OpenAI、強化学習による自動レッドチーミングでChatGPT Atlasのプロンプトインジェクション耐性を継続強化
tech/ai news
ワンポイント強化学習の自動レッドチームでAtlasの脆弱性を先回り発見・修正
この記事は OpenAI News の一次情報をもとにAIが再構成したものです。 原文を読む →
OpenAIは、強化学習で訓練した自動レッドチーミングの仕組みを使い、ブラウザエージェント「ChatGPT Atlas」のプロンプトインジェクション対策を継続的に強化していると発表しました。未知の攻撃手法を先回りで発見し修正する「discover-and-patch」ループにより、AIがより自律的(エージェント的)になる中での防御力向上を狙います。
全文を読むには有料プランへの登録が必要です。
プランを見る →