OpenAI、EUでChatGPT向けにtextGrainウォーターマーキングを展開
OpenAIは、EU AI Actの遵守のため、European Union(欧州連合)においてChatGPTとCodex向けの不可視テキストウォーターマークをロールアウトしています。この手法はtextGrainと呼ばれています。
英語の原文から自動翻訳されました。
OpenAIは、European Union(欧州連合)内で同社のChatGPTおよびCodexモデルによって生成されたテキストに対する不可視ウォーターマーキングシステムの実装を開始しました。月曜日に発表されたこの動きは、8月2日に発効したEU AI Actの透明性要件に自社の運用を合わせることを目的としています。今後数週間のうちに、対象地域のすべてのサブスクリプションプランの利用者に影響が及びます。
何が起きたか
この変更の主な要因は規制コンプライアンスです。EU AI Actでは、汎用AIモデルのプロバイダーに対し、他のシステムがAI生成コンテンツを識別できるように、出力内容を機械可読形式でマークすることが義務付けられています。OpenAIは、ヨーロッパ以外の地域では規制環境が異なるため、ローンチ時点でこの機能をグローバルなデフォルト設定にはしないと述べています。ただし、世界中どこからでもOpenAI APIを利用する開発者は、一部のモデルに対してウォーターマークを有効化できるようになりましたが、デフォルトではオフのままです。
この決定は、2か月前にAnthropicがClaudeモデル向けにワールドワイドなウォーターマーキングを導入すると発表したことに続くものです。その動きは、ユーザーの創造的な入力がAIに誤って帰属されていると感じたユーザーの間で議論を巻き起こしました。OpenAIは以前からウォーターマーキング技術を開発していましたが、競合他社がこの種のマーカーを課していない場合にユーザーが流出することを懸念し、リリースを遅らせていたと報じられています。現在、Anthropic、Google、Meta、Microsoftとともに、OpenAIもAI生成コンテンツに関するEUの行動規範へのコミットメントを示しています。
仕組み
University of Pennsylvania(ペンシルベニア大学)とYale University(イェール大学)の研究者との共著による技術レポートで詳細が説明されているウォーターマーキング技術は、textGrainと呼ばれています。これはドキュメントに目に見えるシンボルやメタデータを挿入するものではありません。代わりに、生成中のモデルの単語選択に微妙な影響を与えます。秘密鍵を使用して次の単語予測をソートすることで、モデルは人間の読者には見えないパターンを形成する、統計的に検出可能な特定の選択を行います。
ウォーターマークはテキスト自体の言語構造に埋め込まれているため、コンテンツをコピー&ペーストしても持続します。検出器は、テキストと対応する秘密鍵のみを使用してAI由来であることを識別できます。OpenAIは、textGrainの有効化により、モデルのパフォーマンスや出力品質に有意な劣化は生じなかったと報告しています。このシステムはテキストを生成した特定のユーザーを識別するものではなく、ソースモデルをマークしつつ匿名性を保持します。
主要な詳細
- ウォーターマークは今後数週間で、EU内のChatGPTおよびCodexユーザーにロールアウトされます。
- API開発者は本日開始時点で、一部のモデルに対してこの機能をグローバルに有効化できますが、デフォルトではオフです。
- textGrainと呼ばれるこの手法は、読みやすさに影響を与えることなく、秘密鍵を使用して単語選択を形作ります。
- 編集を行うと検出率は大幅に低下します。単語の10%を同義語に置き換えると、検出率は92%から66%に低下しました。
- 短い文章、数学の答え、翻訳されたテキストは、現時点では検出器にとって識別がより困難です。
- 検出ツールへのアクセスは当初、承認された研究者および専門家組織に限定されています。
なぜ重要なのか
大規模言語モデルを組み込んだ製品を構築しているエンジニアリングチームにとって、この変化はコンテンツの出所とコンプライアンスに関する新たな考慮事項をもたらします。アプリケーションがEU内のユーザーにサービスを提供する場合、送信されるテキストにこれらの統計的マーカーが含まれる可能性があることを考慮する必要があります。ウォーターマークはパフォーマンスに影響を与えませんが、生の出力の性質を変えます。開発者は、テキストがもはや「中立」なものではなく、サードパーティのツールによって検証可能なシグネチャを帯びていることを理解する必要があります。
さらに、textGrainの制限は現在の帰属技術の脆さを浮き彫りにしています。軽微な編集でも検出精度を大幅に低下させる可能性があるという事実は、ウォーターマークが作成者の有無に関する決定的な証明として機能しないことを意味します。ウォーターマークが存在しないことは人間による作成を証明しません。テキストが短すぎる場合、 heavily edited(大幅に編集されている)場合、またはウォーターマークのないモデルによって生成された可能性があるからです。このニュアンスは、モデレーションや検証パイプラインを設計するチームにとって重要であり、ウォーターマーク検出のみに依存することは偽陰性(false negatives)につながる可能性があります。
できること
- データ処理パイプラインを見直し、AI生成テキストのストレージがEUコンプライアンスのために更新が必要かどうかを判断してください。
- ステージング環境でAPIのオプションのウォーターマーキング機能をテストし、特定のユースケースにおけるエッジケースを評価してください。
- ユーザー向けドキュメントを更新し、AI支援コンテンツに識別用の不可視マーカーが含まれる可能性があることを明確にしてください。
- リスクの高いモデレーションワークフローにおいて、人間の作成者確認のためにウォーターマーク検出のみに依存しないでください。
- 検出信頼性と潜在的な対策に関する最新情報について、textGrainの技術レポートを監視してください。
- 法務顧問と協議し、製品のAI生成コンテンツの取り扱いがEU AI Actの透明性ルールを満たしていることを確認してください。



