ClouisleClouisle

知识库指南

创建知识库、导入文档、调整分块并验证检索质量

知识库为团队保存可检索的文档集合:原始文件或网页先被解析为文本、切分成分块(chunk),再由团队的嵌入模型转成向量写入向量库。检索时按相似度召回分块,交给 Agent 或工作流作为上下文使用。本栏目按使用顺序覆盖五个环节,其余参数细节见知识库设置参考。

前置条件

你的团队必须已获授权一个 embedding 模型才能创建可检索的知识库;要启用重排序还需授权一个 rerank 模型。授权与供应商配置见模型管理,未授权模型会在创建或检索时被拒绝。

关键默认值

项目默认值说明
分块大小 chunk_size1000 字符最小 100;字符而非 Token
分块重叠 chunk_overlap100 字符最小 0
重排序 rerank_enabledtrue未绑定 rerank 模型时不产生效果
重排序候选池 rerank_candidate_k10范围 1-100
检索请求 search_modehybrid知识库设置中默认留空(null)
检索请求 top_k5请求范围 1-20
单文件上传上限50MB站点设置 kb_document_max_upload_size_mb,范围 1-1024

一条文档的生命周期

上传/导入 → pending → 预览分块(可选) → 处理 → 提取文本 → 清理 → 分块 → 生成嵌入 → 建立全文索引 → completed

只有 completed 的文档会参与检索。pending 只是「文件已保存」,不等于已建立索引,详见导入文档。

调优建议(分块粒度、权重、阈值如何取舍)见知识库优化,概念层面的摄取与检索全流程见知识库概念。

这篇文章对你有帮助吗?

本页目录