Cloudflare AI Searchが一般公開、ネイティブ画像埋め込みとOCR機能を追加
CloudflareのAI Searchが正式に一般公開され、ネイティブ画像埋め込み、PDF向けOCR、より大きなファイルへの対応が追加されました。課金は2026年11月1日から開始されます。
英語の原文から自動翻訳されました。
Cloudflareは、AI Search製品をプレビューから一般提供(GA)へ移行しました。これは、検索拡張生成(RAG)パイプラインを開発するエンジニアにとって重要なステップです。今回のアップデートでは、マルチモーダル機能がネイティブで導入され、視覚コンテンツからの直接画像埋め込みやスキャン済みドキュメント向けの光学文字認識(OCR)が可能になりました。サービスの課金は2026年11月1日に開始されますが、小規模なワークロード向けの無料プランも引き続き利用可能です。
何が起きたか
このリリースにより、プラットフォームは単純なテキストを超えた複雑なデータタイプを処理できるようになりました。従来、画像検索は視覚コンテンツからテキストキャプションを生成し、そのキャプションを埋め込む手法に依存していました。このアプローチでは、チャートや図表内のテクスチャ、カラーパレット、空間的な関係性など、細かな視覚的ディテールが失われることが多くありました。新しいシステムでは、キャプションによるテキスト理解と、ネイティブ画像埋め込みによる直接的な視覚信号の両方を保持します。
マルチモーダルサポートに加え、Cloudflareは取り込み時の最大ファイルサイズを4 MiBから10 MiBに増やしました。これにより、より大規模なドキュメントセットやリッチなメディア資産に対応できます。また、選択可能なテキストではなくスキャン画像で構成されるPDFに対して、光学文字認識(OCR)を有効化しました。有効にすると、システムはチャンク分割と埋め込みの前に各ページからテキストを抽出するため、レガシーなスキャン済みドキュメントも検索可能になります。
一般提供への移行に伴い、価格体系も確定しました。2026年8月のAgents Week期間中にCloudflareはプレビュー価格を発表しましたが、最終モデルでは無料プランに若干の調整が加えられました。共有クエリプールではなく、ユーザーはセマンティック検索とフルテキスト検索それぞれに対して個別の割り当てを受け取ります。課金エンジンは、取り込みトークン数、ストレージ容量、クエリタイプに基づいてコストを計算するため、事前のキャパシティプランニングは不要です。
仕組み
画像処理における核心的な改善は、Matryoshka Representation Learning(マトリョーシカ表現学習)技術に基づいています。この技術により、システムは異なる粒度レベルで有用な情報を保持する埋め込みを作成できます。これにより、ストレージ要件を管理可能な範囲に抑えつつ、検索速度を維持します。Qwen3-VL-Embeddingモデルがネイティブマルチモーダル検索を支え、画像ピクセルとテキストを同じベクトル空間に配置します。
ユーザーがクエリを送信すると、システムは選択された埋め込みモデルが画像をサポートしているかどうかを確認します。サポートしている場合、クエリ画像は直接埋め込まれます。モデルがテキストのみをサポートしている場合、システムはToMarkdownというツールを使用して画像をテキストに変換し、結果として得られたキャプションを使って検索を行います。このデュアルパスアプローチにより、異なるモデル設定間での互換性が確保されると同時に、マルチモーダルモデルを使用する場合の精度向上が実現します。
スキャン済みドキュメントの場合、光学文字認識機能は前処理ステップとして機能します。標準的なインデックス作成パイプラインが始まる前に、画像ベースのPDFからテキストを読み取ります。このプロセスは画像処理取り込みトークンを消費し、基本的なテキスト取り込みとは別に課金されます。解析、チャンク分割、リランキングを含む残りのパイプライン部分は、基本的な取り込みコストに含まれています。
主要な詳細
- ネイティブ画像埋め込みはQwen3-VL-Embeddingモデルを使用し、テクスチャやレイアウトなどの視覚的ディテールを保持します。
- テキストファイルおよびPDFの取り込み時最大ファイルサイズが4 MiBから10 MiBに増加しました。
- スキャン済みPDF向けの光学文字認識が利用可能で、画像処理取り込みトークンとして課金されます。
- 課金は2026年11月1日に開始され、インスタンス時間や月額最低料金は不要です。
- 無料プランには、毎月500万取り込みトークン、10 GBのストレージ、1,000回のセマンティッククエリ、1,000回のフルテキストクエリが含まれます。
- 基本取り込みコストは100万トークンあたり0.75ドルで、画像処理には追加で100万トークンあたり0.50ドルがかかります。
なぜ重要なのか
検索インターフェースを構築するエンジニアリングチームにとって、キャプションベースからネイティブ画像検索への移行は、メタデータキュレーションの手間を軽減します。開発者は視覚的なニュアンスを捉えるために網羅的な説明を書く必要がなくなり、これはeコマースカタログ、技術図面、スクリーンショットライブラリなどで特に価値があります。視覚的類似性やテキストと画像を組み合わせたクエリによる検索が可能になることで、以前はカスタムコンピュータビジョンパイプラインなしでは実装が難しかった新たなユースケースが開かれます。
価格モデルの透明性は、チームがコストをより正確に予測するのに役立ちます。取り込み、ストレージ、クエリのみに対して課金することで、Cloudflareはサーバーインスタンスの管理やスケーリングユニットの運用オーバーヘッドを排除します。この従量課金制の構造は、スタートアップやサイドプロジェクトの参入障壁を下げる一方、充実した無料プランにより、有料利用へのコミット前に十分な実験が可能になります。
より大きなファイルやスキャン済みドキュメントへのサポートは、エンタープライズナレッジベースにおける一般的な課題に対処します。多くの組織は、事実上テキストのスキャン画像であるレガシーPDFに依存しています。OCRを標準機能として有効にすることで、これらのドキュメントを外部の前処理ツールなしで最新のAI検索ワークフローに統合できます。これにより、包括的な社内検索エンジンを構築するために必要なアーキテクチャが簡素化されます。
できること
- 現在のドキュメントリポジトリを監査し、新しいOCR機能から恩恵を受けるスキャン済みPDFを特定してください。
- イメージ資産の一部でQwen3-VL-Embeddingモデルをテストし、ネイティブ視覚検索の精度を評価してください。
- 取り込み、ストレージ、クエリの公表レートを使用して予想月間コストを計算し、11月の課金開始に向けた予算を立ててください。
- よりリッチなコンテンツのためのサイズ制限増加を活かし、最大10 MiBまでのファイルを処理するように取り込みパイプラインを更新してください。
- 無料プランの制限を確認し、現在の開発およびテストワークロードが500万トークンと10 GBストレージの割り当て内に収まるかどうかを判断してください。
- 視覚的に重いデータセットの関連性を高めるため、テキスト説明と画像入力を組み合わせたハイブリッド検索クエリを検討してください。


