← 技术文章
本地大模型 RAG 实践笔记
从模型选型到检索优化的完整实践路径。
为什么要在本地跑
很多企业场景对数据隐私有硬性要求,知识库里往往包含不能出内网的内部资料。把大模型部署在本地,让数据「不出内网」,是这类场景绕不开的前提。
关键环节
- 模型选型:在推理速度、显存占用与回答质量之间权衡,最终选择了量化后的中等规模模型。
- 检索质量:RAG 的效果上限很大程度由检索决定。向量召回之后加一层重排序(rerank),能显著提升相关片段的排名。
- 上下文组织:把检索到的片段拼进 prompt 时,顺序、去重和长度控制都会影响最终回答。
踩过的坑
最容易被忽视的是「切分策略」——文档如何分块直接影响召回的粒度。切得太细会丢失上下文,切得太粗又会引入噪声。没有万能参数,只能结合具体文档反复调。