Difyのナレッジの作り方|RAGの構築手順とチャンク設定
・ Employee Store 運用局

この記事のまとめ
Difyのナレッジを使うと、社内のマニュアルやFAQに沿って答えるAIアプリを作れます。この記事では、ナレッジベースを作る手順と、チャンク設定や検索方式の選び方、アプリへのつなぎ方を説明します。内容は2026年10月に公式ドキュメントで確かめました。
Difyのナレッジは、資料を取り込んで、AIに検索させる機能です。この記事では、ナレッジベースの作り方と使い方を、設定の意味から順に説明します。画面の名前は英語のまま書きます。
上限や初期値は、2026年10月2日に Dify の公式ドキュメントと料金ページで確かめたものです。変わることがあるため、使う前に末尾の出典で確かめてください。
Difyのナレッジとは
Difyのナレッジは、自社のデータを集めて、AIアプリに組み込むための機能です。モデルが学習した一般的な知識だけでなく、自社の資料を根拠に答えさせられます。この仕組みは RAG(検索拡張生成)と呼ばれます。
- 検索:質問を受けると、ナレッジから関係の深い部分を探す
- 拡張:見つけた部分を、元の質問と一緒にモデルへ渡す
- 生成:モデルが、渡された内容を踏まえて答えを作る
資料は、ナレッジベースという単位で保存します。分野や用途ごとに複数のナレッジベースを作り、アプリごとに選んでつなげます。RAG とAIエージェントの違いはAIエージェントとRAGの違いで説明しています。
ナレッジベースの作り方は3つあります。この記事では、初めての人向けの1つ目を説明します。
- Ready-to-use:資料を入れて処理のルールを決めれば、あとは Dify が処理する
- Custom:処理の手順を自分で組み立てる(Knowledge Pipeline)
- External:外部のナレッジベースに API でつなぐ
- 1資料を入れるファイル、Notion、Webサイトから
- 2チャンク設定資料を小さな塊に分ける
- 3インデックスと検索方式どう探すかを決める
- 4処理を待つ終わればアプリから使える
資料の準備:形式と前処理
Knowledge の画面で Create を押し、Ready-to-use のナレッジベースを選びます。資料の入れ方は、手元のファイルのアップロード、Notion との同期、Webサイトの取り込みの3つです。空のナレッジベースも作れます。作った後に、資料の入れ方は変えられません。
| 項目 | Sandbox | Professional | Team |
|---|---|---|---|
| 1回にアップロードできるファイル | 1つ | 50 | 50 |
| 1ファイルの大きさ | 15MBまで | 50MBまで | 50MBまで |
| 取り込める資料の数 | 50 | 500 | 1,000 |
| ナレッジの保存容量 | 50MB | 5GB | 20GB |
Word(DOCX)と Excel(XLSX)の中の画像は、2MB未満の JPG、PNG、GIF なら自動で取り出されます。取り出された画像は、対応する塊に添付されます。
分ける前に、文字を整える前処理も選べます。連続した空白や改行をまとめる処理と、URLとメールアドレスを消す処理です。検索に関係のない文字を減らすと、検索の質が上がります。
個人情報を含む資料に注意する
個人情報保護委員会は、2023年6月2日に生成AIサービスの利用について注意喚起をしています。事業者が個人情報を含むプロンプトを入れるときは、利用目的の範囲内かを確かめるよう求めています。本人の同意なく個人データを入れ、それが応答以外の目的で扱われると、法律違反になる可能性があります。そのため、提供元がデータを機械学習に使わないことなどを確かめるよう求めています。
ナレッジから見つかった部分は、質問のたびにモデルへ渡ります。High Quality の方式では、資料を Embedding モデルにも渡します。顧客名簿などを入れる前に、使うモデルの提供元がデータをどう扱うかを確かめます。
チャンク設定の考え方
取り込んだ資料は、チャンクという小さな塊に分けられます。質問を受けると、この塊の中から関係するものを探します。大きな本を章と段落に分けておくと探しやすい、という考え方です。
- 区切り文字:どこで分けるかを決める文字。空行で段落ごと、改行で行ごとに分けられる。区切り文字は分けるときに消えるため、本文に出てこない文字を使う
- 最大の長さ:1つの塊の最大の文字数。超えた部分は区切り文字に関係なく分けられる
- 重なり:General モードで、隣の塊と重ねる文字数。50文字にすると、前の塊の最後の50文字が次の塊の最初にも入る
分け方のモードは2つです。モードはナレッジベースを作った後に変えられません。区切り文字と最大の長さは、後からでも変えられます。
General
- すべての塊を同じ設定で分ける
- 見つかった塊をそのまま返す
- 用語集やFAQのような短い資料向き
Parent-child
- 小さな子の塊で探し、大きな親の塊を返す
- 正確に探せて、前後の文脈も渡せる
- 技術マニュアルなど情報の多い資料向き
Parent-child では、親の塊を段落ごとに作るか、資料全体を1つの親にするかを選びます。資料全体を親にする場合、処理されるのは最初の10,000トークンまでです。設定を決めたら、Preview で分かれ方を確かめます。
検索方式の選び方:ベクトル・全文・ハイブリッド
次に、インデックスの方式を選びます。High Quality と Economical の2つです。
- High Quality:Embedding モデルで塊を数値の並び(ベクトル)に変え、意味の近さで探す。作った後で Economical には戻せない
- Economical:1つの塊につき10個のキーワードで探す。トークンを使わない代わりに、精度は下がる。後から High Quality に上げられる
High Quality では、検索方式を3つから選べます。
利用者はどう質問するか
どの方式でも、TopK と Score Threshold を設定できます。TopK は返す塊の数で、初期値は3です。Score Threshold は返す最低の近さで、初期値は0.5です。ベクトル検索と全文検索では、この2つは Rerank モデルを使うときだけ効きます。Rerank モデルを使うと、そのモデルのトークンの費用がかかります。
保存容量にも関わります。High Quality で作ったベクトルは、ワークスペースの保存容量を使います。量はファイルの大きさではなく、塊の数で決まります。Economical は容量を使いません。
アプリからナレッジを呼び出す
ナレッジベースは、どの種類のアプリにもつなげます。Chatbot の場合の流れは次のとおりです。
- Studio で Chatbot のアプリを作る
- Context の Add で、作ったナレッジベースを選ぶ
- Retrieval Setting で検索の設定を調整する
- 機能の追加で Citation and Attribution を入れ、答えに出典を表示する
- プレビューで資料に関係する質問をして確かめ、公開する
Chatflow と Workflow では、Knowledge Retrieval ノードを使います。ノードで探した結果を LLM ノードに文脈として渡し、答えを作らせます。Chatflow なら、最後に Answer ノードで返します。
検索の設定は、ナレッジベース側とアプリ側の2段階です。ナレッジベース側で候補を集め、アプリ側で並べ直したり絞ったりします。複数のナレッジベースをつなぐ場合、重みで並べ直す設定は、すべてが High Quality のときだけ使えます。
答えの精度を上げる見直し方
答えがずれるときは、検索で正しい塊が見つかっているかを先に確かめます。
- Retrieval Testing:ナレッジベースの画面で、質問を入れて検索だけを試す。ここで変えた設定は、その場だけのもの
- Records:試した検索と、アプリからの実際の検索の記録が残る
- 塊を直す:分かれ方がずれている塊は、後から手で直せる
- メタデータで絞る:資料に属性を付け、条件に合う資料だけを探す
公式ドキュメントは、方式の選び方も示しています。利用者が正確な用語を知っているなら、キーワードの重みを1にします。資料に同じ語がない場合や、言語をまたぐ質問なら、意味の重みを1にします。資料が複雑で精度が必要なら、Rerank モデルを検討します。
Dify の基本はDifyの使い方で、ナレッジを使った問い合わせ対応の例はAIエージェントのヘルプデスク活用で紹介しています。
作ったアプリを Employee Store に出品する
Employee Store は、開発者が作ったAIエージェントを、会社が買い切りや月額で導入できるマーケットプレイスです。形式は問いません。Dify のアプリも掲載できます。掲載料と初期費用はかかりません。手数料は成約金額の20%で、成約したときだけ発生します。詳しくは出品者向けの案内をご覧ください。
よくある質問
- Difyのナレッジとナレッジベースは違うものですか?
- ナレッジは、自社のデータをAIアプリに組み込む機能の名前です。資料はナレッジベースという単位で保存し、管理します。1つのワークスペースに、複数のナレッジベースを作れます。
- チャンクの長さはどう決めればよいですか?
- 決まった正解はありません。短い塊は正確に探せますが文脈が足りず、長い塊は文脈が多い代わりに精度が下がります。Preview と Retrieval Testing で試して決めます。両方が必要なら Parent-child モードを検討します。
- 保存容量がいっぱいになるとどうなりますか?
- 資料の追加、塊の追加や編集、チャンク設定の変更などができなくなります。不要な資料を消すか、プランを上げると、また追加できます。プランを下げて上限を超えた場合も、データは消えず、アプリからの検索は続けられると説明されています。
出典
- Dify Docs「Knowledge」
- Dify Docs「Create a Ready-to-Use Knowledge Base」
- Dify Docs「Upload Local Files」
- Dify Docs「Configure the Chunk Settings」
- Dify Docs「Specify the Index Method and Retrieval Settings」
- Dify Docs「Knowledge Data Storage Limit」
- Dify Docs「Integrate Knowledge within Apps」
- Dify Docs「Knowledge Retrieval node」
- Dify Docs「Test Knowledge Retrieval」
- Dify「Pricing」(2026年10月2日確認)
- 個人情報保護委員会「生成AIサービスの利用に関する注意喚起等について」
- 個人情報保護委員会「生成AIサービスの利用に関する注意喚起等」(別添1)
- Employee Store「出品者向け案内」


