AIで開発する

Cloudflare、構造化AIタスク向けマルチモーダル意思決定モデル「Clef」をリリース

Cloudflareは、ドキュメント抽出とルーティングに最適化された27Bパラメータのモデル「Clef」を発表しました。Ollamaを通じてテキストと画像を単一のパスで処理します。

A glass cube with circuit layers and document icons representing multimodal AI processing.
この記事用に生成されたイラスト

英語の原文から自動翻訳されました。

Cloudflareは、ドキュメントフィールドの抽出やリクエストのルーティングなど、構造化されたタスクを処理するために設計された新しいマルチモーダル意思決定モデル「Clef」を導入しました。2026年10月初頭にリリースされたこの270億パラメータのモデルは、Qwen3.8-27Bからファインチューニングされており、標準的なAPIを通じて既存のAIエンジニアリングワークフローに直接統合されています。

何が起きたか

Clefは、汎用チャットボットではなく、専門的な意思決定モデルへのシフトを示しています。このモデルは、テキスト、JSON構造、および画像を同時に処理する能力を持っています。これにより、スクリーンショット、レシート、フォーム、写真などをテキストデータとともに分析し、確定的な意思決定を行うことが可能になります。Cloudflareによると、Clefは現在、同社の内部リーダーボードであるDecision Indexで首位を走っており、多くのベンチマークスイートにおいて先行モデルであるJevを上回っています。

今回のリリースには、JevおよびSystem One APIとの完全な互換性が含まれています。つまり、開発者は統合ロジックを書き直すことなく、Ollamaの/v1/systemoneエンドポイントを使用してClefを展開できます。最大精度よりもレイテンシが重要なユースケース向けに、より小さく高速なバリアントであるclef-flashも利用可能です。両バージョンともApache 2.0ライセンスの下で公開されており、広範な商用およびオープンソースでの採用が可能になっています。

仕組み

トークンごとにテキストを生成する従来の自己回帰言語モデルとは異なり、Clefは単一の非自己回帰フォワードパスで動作します。すべての質問に対するすべての選択肢を同時にスコアリングします。このアーキテクチャにより、分類および抽出タスクにおける推論時間が大幅に短縮されます。なぜなら、モデルは結論に至る前に冗長な説明を生成する必要がないためです。代わりに、事前定義された選択肢に対する構造化された確率を出力します。

このモデルは64Kコンテキストウィンドウをサポートしており、これはJevの32Kウィンドウの2倍の容量です。この大きなコンテキストにより、Clefは長いドキュメントや複雑な指示セットを一括して処理できます。リクエストに画像が含まれる場合、それらはエンコードされ、テキストとともにスコアリングされます。この共同スコアリングにより、フォームのレイアウトやレシートのスタンプなどの視覚的手がかりが、テキストコンテンツと同様に最終的な意思決定に影響を与えます。

開発者は、判定対象のデータであるstateと、questionsリストを送信することでClefと対話します。これらの質問は、多肢選択式、真偽チェック、または評価付きスコアリングなど、必要な意思決定の種類を定義します。モデルは、選択されたオプションとともに、確率分布と信頼度指標を返します。この信頼度スコアは、確率がどれだけ集中しているかを示し、エンジニアが出力を信頼すべきか、あるいは人間のレビュアーにエスカレーションすべきかを判断するのに役立ちます。

主要な詳細

  • モデルサイズ: 270億パラメータ、Qwen3.8-27Bからのファインチューニング。
  • コンテキストウィンドウ: 64Kトークン、長いドキュメントや複雑な指示に対応。
  • 入力タイプ: テキスト、JSON、およびbase64エンコードされた画像(PNG、JPEG、WebP)。
  • 展開: /v1/systemoneエンドポイントを介したOllamaとの互換性;ollama pull clefによるインストールが可能。
  • ライセンス: Apache 2.0、無料の商用利用および修正を許可。
  • 出力形式: 選択肢、確率、信頼度スコアを含む構造化されたJSON。

なぜ重要なのか

AIエージェントを構築するソフトウェアエンジニアにとって、Clefは単純な分類タスクのために大規模言語モデル(LLM)にプロンプトを投げるよりも信頼性の高い代替手段を提供します。汎用LLMは、ドキュメントから特定のフィールドを抽出するよう求められた際、しばしばハルシネーションを起こしたり、一貫性のないフォーマットを提供したりすることがあります。Clefの非自己回帰設計と構造化された出力形式は、モデルに事前定義された選択肢の中から選ばせることで、これらのエラーを削減します。これにより、サポートチケットのルーティングや経費精算書の承認など、決定論的なビジネスロジックへのAI意思決定の統合が容易になります。

テキストと画像を単一のパスで処理できる機能は、マルチモーダルパイプラインも簡素化します。従来、エンジニアは別々のOCRツールと言語モデルを使用し、脆弱なエラーハンドリングでそれらをチェーン接続する必要がありました。Clefはこのプロセスを統一し、スキャンされた請求書を解釈し、日付や合計金額などの主要な値を抽出するために単一のAPI呼び出しを可能にします。オープンソースライセンスは参入障壁をさらに下げ、チームがライセンス費用なしでデータプライバシーコンプライアンスのためにモデルをセルフホストできるようにします。

できること

  • ターミナルでollama pull clefを実行して、Ollamaを使用してローカルにClefをインストールします。
  • 既存の分類プロンプトをClefの構造化された質問形式に置き換えて、精度を向上させます。
  • imagesフィールドを使用して、スクリーンショットやスキャンされたドキュメントを送信し、テキストと画像の共同分析を行います。
  • アプリケーションに信頼度の閾値を実装し、確信度の低い意思決定を人間のレビュー用にフラグ付けします。
  • アプリケーションが高ボリュームタスクでより低いレイテンシを必要とする場合は、clef-flashバリアントをテストします。
  • System One APIのドキュメントを確認し、現在のJev統合をClefにマッピングします。

Bytechapストアのツール

続きを読む

すべての記事