OpenAI、APIテキスト生成向けに任意のtextGrainウォーターマーキング機能を導入
OpenAIは、APIテキスト向けのオプトイン統計的ウォーターマーキングシステム「textGrain」を発表しました。検出率はコンテンツの種類や編集の有無によって異なり、コード生成では大きな課題が生じています。
英語の原文から自動翻訳されました。
OpenAIは、API顧客が生成されたテキストに検出可能な統計的シグナルを埋め込める新しいウォーターマーキングシステム「textGrain」をリリースしました。2026年10月5日に開始されたこの機能は、対応モデル向けのオプトインツールとして世界中で利用可能となり、同社がテキスト出力におけるコンテンツの出所(プロベナンス)をどのように扱うかという点において転換点を示しています。
何が起きたのか
新システムにより、開発者はAPIで生成されたテキストに隠し識別子を含めるかどうかを選択できるようになりました。これまでの画像や音声のウォーターマーキングとは異なり、APIユーザーにとってtextGrainはデフォルトでオフになっています。このアプローチにより、顧客は透明性義務への対応方法やユーザー体験の管理方法を自ら制御できます。OpenAIは、この柔軟性により組織がウォーターマーキングを自社の特定のニーズに合わせて決定できると述べています。
今後数週間のうちに、同社は欧州連合(EU)内でChatGPTおよびCodexによって生成される対象テキストに対して自動的にウォーターマーキングを開始する予定です。これはEU AI法に基づく新たな透明性要件に沿った動きです。APIユーザーにはこの機能を手動で有効にする必要がありますが、EU内の消費者向け製品では地域規制に準拠するため、デフォルトで適用されます。
この戦略は、8月に発表されたAnthropicのアプローチとは対照的です。Anthropicは、開発者によるオプトアウトを許さず、API出力を含むすべての対応Claudeモデルにグローバルにウォーターマーキングを適用しています。Anthropicは、地域ごとに技術を制限することの技術的限界を包括的適用の理由として挙げています。OpenAIの方法はより細かな制御を提供し、個々のAPIリクエストに変更を加えることなく、プロジェクトまたは組織レベルでの有効化を可能にします。
仕組み
textGrainは、単語選択に微妙な影響を与えることでテキストに統計的シグナルを埋め込みます。モデルがテキストを生成する際、特定の文脈に対して複数の適切な単語選択肢が存在することがよくあります。システムは隠れたパターンに基づいて、ある有効な選択肢を別の選択肢よりも優先します。長い文章全体を通じて、これらの微細な判断が集まり、OpenAIの検出器が識別できる検出可能な署名を作成します。
OpenAIは、GoogleのSynthIDやMetaのTextSealといった既存の標準を採用せず、textGrainを内部で開発しました。同社は、このカスタムアプローチにより、検出可能性と応答の多様性のバランスに対するより良い制御が可能になると主張しています。社内テストでは、textGrainがSynthIDの検出性能に匹敵するか、それを上回る結果を示唆しています。OpenAIは、外部からの改善とテキストプロベナンス分野でのより広範な採用を奨励するために、この技術をオープンソース化する計画です。
主要な詳細
- textGrainは世界中のAPI顧客向けにオプトインですが、間もなくEU内ではChatGPTとCodexに対して自動的に適用されます。
- 心理学などの分野では、200トークンの文章で約80%、400トークンの文章で95%の検出率に達します。
- システムは誤検知率を1%に抑えることを目標としており、陽性検出に対する高い信頼性を確保しています。
- 編集を行うとシグナルが大幅に弱まります。単語の10%を置き換えると検出率が92%から66%に低下し、25%の置き換えでは17%まで減少します。
- コード生成は、妥当なトークン選択肢が少ないためウォーターマーキングが難しいですが、OpenAIはコーディングベンチマークにおいて有意な性能低下はないと報告しています。
- 検出器へのアクセスは現在、プロベナンスと検出信頼性を研究している承認済みの研究機関および学術組織に限定されています。
なぜ重要なのか
AIアプリケーションを構築するソフトウェアエンジニアにとって、テキストウォーターマーキングの限界を理解することは重要です。この技術はコンテンツ認証の万能薬ではありません。検出の信頼性は、テキストの長さとドメインに大きく依存します。短い文章では信頼できる識別に必要なデータが不足する場合があり、数学のような制約のあるドメインでは、意味を変えずに統計的シグナルを埋め込むためのモデルの機会が少なくなります。
編集に対するウォーターマークの脆弱性は、人間によるレビュー(human-in-the-loop refinement)を含むワークフローにとって課題となります。開発者やユーザーが生成テキストの相当部分を編集した場合、ウォーターマークが検出されなくなる可能性があります。これにより、共同編集されたドキュメントの出所を検証するための有用性が制限されます。さらに、検出器へのアクセス制限のため、ほとんどの商用APIユーザーはウォーターマークを自ら検証できず、代わりにOpenAIの内部ツールや将来の公開リリースに頼ることになります。
散文とコードの違いは、Codexを使用するチームにとって特に重要です。コード構文は厳格であるため、シグナルを埋め込むために利用可能な同義語や構造変形の選択肢が少なくなります。OpenAIは性能が安定していると主張していますが、生成されたコード内のウォーターマークを検出できる能力は依然として不確実です。開発者は、この方法を使用してすべてのAI生成コードを確実にその出所に遡及できると仮定すべきではありません。
あなたができること
- アプリケーションがコンテンツのプロベナンスを必要とするかどうかを評価し、必要に応じてプロジェクトまたは組織レベルでtextGrainを有効にしてください。
- 具体的なユースケースで検出の信頼性をテストしてください。短いテキストや技術的なドメインでは成功率が低くなる可能性があることに注意してください。
- 特に自動ウォーターマーキングが間もなく適用されるEUで事業を行っている場合は、ウォーターマーキングポリシーについてユーザーに告知してください。
- ウォーターマークを独立して検証する必要がある場合、検出器アクセスの拡大に関するOpenAIの発表を監視してください。
- 人間のレビューを含むワークフローを設計する際には、生成後の編集がウォーターマークの完全性に与える影響を検討してください。
- textGrainの今後のオープンソースリリースに注目し、検出機能を自社システムに統合できる可能性を探ってください。



