EN
← 技术文章

2026 年 5 月 10 日

本地大模型 RAG 实践笔记

从模型选型到检索优化的完整实践路径。

为什么要在本地跑

很多企业场景对数据隐私有硬性要求,知识库里往往包含不能出内网的内部资料。把大模型部署在本地,让数据「不出内网」,是这类场景绕不开的前提。

关键环节

  1. 模型选型:在推理速度、显存占用与回答质量之间权衡,最终选择了量化后的中等规模模型。
  2. 检索质量:RAG 的效果上限很大程度由检索决定。向量召回之后加一层重排序(rerank),能显著提升相关片段的排名。
  3. 上下文组织:把检索到的片段拼进 prompt 时,顺序、去重和长度控制都会影响最终回答。

踩过的坑

最容易被忽视的是「切分策略」——文档如何分块直接影响召回的粒度。切得太细会丢失上下文,切得太粗又会引入噪声。没有万能参数,只能结合具体文档反复调。

AI
👋 Hi,我是小瑞。想了解我吗?随便聊聊~
和我聊聊 →