出品する

Difyのナレッジの作り方|RAGの構築手順とチャンク設定

・ Employee Store 運用局

この記事のまとめ

Difyのナレッジを使うと、社内のマニュアルやFAQに沿って答えるAIアプリを作れます。この記事では、ナレッジベースを作る手順と、チャンク設定や検索方式の選び方、アプリへのつなぎ方を説明します。内容は2026年10月に公式ドキュメントで確かめました。

Difyのナレッジは、資料を取り込んで、AIに検索させる機能です。この記事では、ナレッジベースの作り方と使い方を、設定の意味から順に説明します。画面の名前は英語のまま書きます。

上限や初期値は、2026年10月2日に Dify の公式ドキュメントと料金ページで確かめたものです。変わることがあるため、使う前に末尾の出典で確かめてください。

Difyのナレッジとは

Difyのナレッジは、自社のデータを集めて、AIアプリに組み込むための機能です。モデルが学習した一般的な知識だけでなく、自社の資料を根拠に答えさせられます。この仕組みは RAG(検索拡張生成)と呼ばれます。

  1. 検索:質問を受けると、ナレッジから関係の深い部分を探す
  2. 拡張:見つけた部分を、元の質問と一緒にモデルへ渡す
  3. 生成:モデルが、渡された内容を踏まえて答えを作る

資料は、ナレッジベースという単位で保存します。分野や用途ごとに複数のナレッジベースを作り、アプリごとに選んでつなげます。RAG とAIエージェントの違いはAIエージェントとRAGの違いで説明しています。

ナレッジベースの作り方は3つあります。この記事では、初めての人向けの1つ目を説明します。

  • Ready-to-use:資料を入れて処理のルールを決めれば、あとは Dify が処理する
  • Custom:処理の手順を自分で組み立てる(Knowledge Pipeline)
  • External:外部のナレッジベースに API でつなぐ
ナレッジベースを作る手順
  1. 1資料を入れるファイル、Notion、Webサイトから
  2. 2チャンク設定資料を小さな塊に分ける
  3. 3インデックスと検索方式どう探すかを決める
  4. 4処理を待つ終わればアプリから使える

資料の準備:形式と前処理

Knowledge の画面で Create を押し、Ready-to-use のナレッジベースを選びます。資料の入れ方は、手元のファイルのアップロード、Notion との同期、Webサイトの取り込みの3つです。空のナレッジベースも作れます。作った後に、資料の入れ方は変えられません。

プランごとの上限(2026年10月確認)
項目SandboxProfessionalTeam
1回にアップロードできるファイル1つ5050
1ファイルの大きさ15MBまで50MBまで50MBまで
取り込める資料の数505001,000
ナレッジの保存容量50MB5GB20GB

Word(DOCX)と Excel(XLSX)の中の画像は、2MB未満の JPG、PNG、GIF なら自動で取り出されます。取り出された画像は、対応する塊に添付されます。

分ける前に、文字を整える前処理も選べます。連続した空白や改行をまとめる処理と、URLとメールアドレスを消す処理です。検索に関係のない文字を減らすと、検索の質が上がります。

個人情報を含む資料に注意する

個人情報保護委員会は、2023年6月2日に生成AIサービスの利用について注意喚起をしています。事業者が個人情報を含むプロンプトを入れるときは、利用目的の範囲内かを確かめるよう求めています。本人の同意なく個人データを入れ、それが応答以外の目的で扱われると、法律違反になる可能性があります。そのため、提供元がデータを機械学習に使わないことなどを確かめるよう求めています。

ナレッジから見つかった部分は、質問のたびにモデルへ渡ります。High Quality の方式では、資料を Embedding モデルにも渡します。顧客名簿などを入れる前に、使うモデルの提供元がデータをどう扱うかを確かめます。

チャンク設定の考え方

取り込んだ資料は、チャンクという小さな塊に分けられます。質問を受けると、この塊の中から関係するものを探します。大きな本を章と段落に分けておくと探しやすい、という考え方です。

  • 区切り文字:どこで分けるかを決める文字。空行で段落ごと、改行で行ごとに分けられる。区切り文字は分けるときに消えるため、本文に出てこない文字を使う
  • 最大の長さ:1つの塊の最大の文字数。超えた部分は区切り文字に関係なく分けられる
  • 重なり:General モードで、隣の塊と重ねる文字数。50文字にすると、前の塊の最後の50文字が次の塊の最初にも入る

分け方のモードは2つです。モードはナレッジベースを作った後に変えられません。区切り文字と最大の長さは、後からでも変えられます。

2つのチャンクモード

General

  • すべての塊を同じ設定で分ける
  • 見つかった塊をそのまま返す
  • 用語集やFAQのような短い資料向き

Parent-child

  • 小さな子の塊で探し、大きな親の塊を返す
  • 正確に探せて、前後の文脈も渡せる
  • 技術マニュアルなど情報の多い資料向き

Parent-child では、親の塊を段落ごとに作るか、資料全体を1つの親にするかを選びます。資料全体を親にする場合、処理されるのは最初の10,000トークンまでです。設定を決めたら、Preview で分かれ方を確かめます。

検索方式の選び方:ベクトル・全文・ハイブリッド

次に、インデックスの方式を選びます。High Quality と Economical の2つです。

  • High Quality:Embedding モデルで塊を数値の並び(ベクトル)に変え、意味の近さで探す。作った後で Economical には戻せない
  • Economical:1つの塊につき10個のキーワードで探す。トークンを使わない代わりに、精度は下がる。後から High Quality に上げられる

High Quality では、検索方式を3つから選べます。

検索方式の選び方

利用者はどう質問するか

言い方が違っても、意味の近い内容を探したいベクトル検索言語が違う資料にも向く
製品名や型番など、決まった語で探すことが多い全文検索語がそのまま含まれる部分を返す
両方の質問がある。迷うハイブリッド検索両方で探し、重みかRerankモデルで並べ直す

どの方式でも、TopK と Score Threshold を設定できます。TopK は返す塊の数で、初期値は3です。Score Threshold は返す最低の近さで、初期値は0.5です。ベクトル検索と全文検索では、この2つは Rerank モデルを使うときだけ効きます。Rerank モデルを使うと、そのモデルのトークンの費用がかかります。

保存容量にも関わります。High Quality で作ったベクトルは、ワークスペースの保存容量を使います。量はファイルの大きさではなく、塊の数で決まります。Economical は容量を使いません。

アプリからナレッジを呼び出す

ナレッジベースは、どの種類のアプリにもつなげます。Chatbot の場合の流れは次のとおりです。

  1. Studio で Chatbot のアプリを作る
  2. Context の Add で、作ったナレッジベースを選ぶ
  3. Retrieval Setting で検索の設定を調整する
  4. 機能の追加で Citation and Attribution を入れ、答えに出典を表示する
  5. プレビューで資料に関係する質問をして確かめ、公開する

Chatflow と Workflow では、Knowledge Retrieval ノードを使います。ノードで探した結果を LLM ノードに文脈として渡し、答えを作らせます。Chatflow なら、最後に Answer ノードで返します。

検索の設定は、ナレッジベース側とアプリ側の2段階です。ナレッジベース側で候補を集め、アプリ側で並べ直したり絞ったりします。複数のナレッジベースをつなぐ場合、重みで並べ直す設定は、すべてが High Quality のときだけ使えます。

答えの精度を上げる見直し方

答えがずれるときは、検索で正しい塊が見つかっているかを先に確かめます。

  • Retrieval Testing:ナレッジベースの画面で、質問を入れて検索だけを試す。ここで変えた設定は、その場だけのもの
  • Records:試した検索と、アプリからの実際の検索の記録が残る
  • 塊を直す:分かれ方がずれている塊は、後から手で直せる
  • メタデータで絞る:資料に属性を付け、条件に合う資料だけを探す

公式ドキュメントは、方式の選び方も示しています。利用者が正確な用語を知っているなら、キーワードの重みを1にします。資料に同じ語がない場合や、言語をまたぐ質問なら、意味の重みを1にします。資料が複雑で精度が必要なら、Rerank モデルを検討します。

Dify の基本はDifyの使い方で、ナレッジを使った問い合わせ対応の例はAIエージェントのヘルプデスク活用で紹介しています。

作ったアプリを Employee Store に出品する

Employee Store は、開発者が作ったAIエージェントを、会社が買い切りや月額で導入できるマーケットプレイスです。形式は問いません。Dify のアプリも掲載できます。掲載料と初期費用はかかりません。手数料は成約金額の20%で、成約したときだけ発生します。詳しくは出品者向けの案内をご覧ください。

よくある質問

Difyのナレッジとナレッジベースは違うものですか?
ナレッジは、自社のデータをAIアプリに組み込む機能の名前です。資料はナレッジベースという単位で保存し、管理します。1つのワークスペースに、複数のナレッジベースを作れます。
チャンクの長さはどう決めればよいですか?
決まった正解はありません。短い塊は正確に探せますが文脈が足りず、長い塊は文脈が多い代わりに精度が下がります。Preview と Retrieval Testing で試して決めます。両方が必要なら Parent-child モードを検討します。
保存容量がいっぱいになるとどうなりますか?
資料の追加、塊の追加や編集、チャンク設定の変更などができなくなります。不要な資料を消すか、プランを上げると、また追加できます。プランを下げて上限を超えた場合も、データは消えず、アプリからの検索は続けられると説明されています。

この記事を書いた人

Employee Store 運用局AIエージェントのマーケットプレイス「Employee Store」の運用チームです。ツールの機能や料金は各社の公式情報で確かめ、出典を記事の最後に載せています。誤りに気づいた方はお問い合わせからお知らせください。

出典

Ask AI

自分の仕事に合うか、AIに聞いてみる。

いつも使っているAIで、できることや導入前の確認点を整理できます。

外部のAIが開きます。料金や提供内容は、出品ページでご確認ください。