项目描述:研究背景:大语言模型在特定领域存在知识幻觉和专业性不足的问题;RAG检索增强推理延迟高;传
统SFT+DPO 微调需要高成本人工标注。本项目将两者结合,用RAG自动构建DPO偏好数据,实现零
标注成本的领域知识内化。
关键步骤:1.知识库构建与RAG检索:领域文档切片后通过BGE-large编码为1024维向量,构建FAISS
索引实现 top-3语义检索。2.偏好数据自动合成:利用7B教师模型分别生成有无 RAG 辅助的回答,通
过 4 维度LLM-asJudge 评分自动构建 DPO 偏好对 3. 两阶段微调与评测::对 1.5B 学生模型依次进
行 SFT 和 DPO 的 LoRA 微调,设计三阶段对比实验。
结论:SFT+DPO 微调后 1.5B 模型综合评分从 4.63 提升至7.43(+60.5%) ,达到教师7B+RAG效果的
90.6% ,推理速度快 4.4 倍且无需检索系统。在法律、金融、医疗三个领域均验证了跨领域通用性。