ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

RAG 岗面试,为什么问到 BGE-M3 就卡住了?十一道题逐个拆解

RAG 岗面试,为什么问到 BGE-M3 就卡住了?十一道题逐个拆解 自我介绍重点讲AIGC/RAG项目为什么这么问考察表达结构、项目真实性、角色边界。判断你是项目核心还是边缘是否有业务结果意识。回答侧重点按业务背景→链路→我的角色→量化成果四段讲每个技术名词后跟一句为什么这么选明确区分从零到一参与设计同事负责。答案 “我主要做财税知识库RAG给企业财务人员做政策问答替代人工翻文档单次查数从十几分钟压到一分钟内。链路是文档解析→结构切分→双路索引→混合召回→重排→生成。检索链路和召回策略是我从零到一做的切分和评测集参与设计前端和标注是同事负责。上线后MRR从0.72提到0.92引用准确率是我们最看重的指标。”你这家公司主要做什么的为什么这么问考察求职前是否做过功课以及能否把业务和技术对应起来业务理解力。回答侧重点一句业务定位一个用户场景技术如何支撑业务。不要背官网slogan。答案 “贵公司做财税数智化方向核心是把财税政策和流程知识结构化给企业财务和代账人员提供问答与检索服务。我理解技术侧主要是知识库建设、语义检索和生成业务侧的核心指标是查得准、有出处。”你们项目人员构成为什么这么问考察团队协作认知和你在团队中的位置判断你的沟通边界。回答侧重点角色规模协作方式重点是我负责的模块如何与上下游衔接。答案 “产品1人、算法2人、后端2人、前端1人、测试1人另有业务方兼职标注。算法里我负责检索和重排同事负责模型微调和生成后端负责接口和数据链路。我这边主要跟业务方对齐标注口径跟后端约定评测数据的落库格式。”你在项目中主要负责什么为什么这么问与自我介绍联动追问细节验证真实性考察职责边界是否清晰。回答侧重点只讲自己负责的模块讲清每个模块的输入输出和踩过的坑不揽全项目。答案 “负责检索链路切分策略、双路召回、RRF融合和重排。典型决策无边框表格的切分本质是版面问题按文档类型做了路由数值类问题走ES精确匹配语义类问题走BGE-M3避免向量检索对编号、文号区分度不足。”没做RAG之前是怎么检索的为什么这么问考察你对RAG价值的理解能否讲出旧方案的痛点和RAG的不可替代性。回答侧重点旧方案是什么痛点在哪RAG补了什么。重点是痛点不是方案罗列。答案 “之前是关键词检索加人工翻目录ES或数据库like查询只能字面匹配用户口语化提问和跨文档综合问题查不到几千份文档靠人工定位。RAG补的是两块语义召回解决’换个说法就搜不到’引用溯源解决’答案有没有出处’。”RAG主要用到哪些工具为什么这么问考察工具链真实性更考察选型理由——你是使用者还是决策者。回答侧重点工具选型理由取舍。每个工具一句为什么是它主动说明过渡或替换决策。答案 “BGE-M3做稠密语义召回要中文多语言、长文档ES做BM25字面匹配和结构化过滤文号、年份Milvus存向量做ANN检索LangChain早期快速验证后续自己封装了链路因为要精细控制上下文组装和重试逻辑。选型原则能确定的用规则和精确匹配语义理解才交给模型。”有哪些评判指标为什么这么问考察评测体系是否完整、数字是否可归因、是否具备数据驱动迭代能力。回答侧重点分检索侧生成侧端到端三层说每个数字配评测集、归因、消融三份材料。答案 “分三层。检索侧RecallK、MRR、nDCG生成侧答案准确率、忠实度、引用准确率端到端人工抽检加bad case归因。评测集用线上真实query采样加业务标注调参集和测试集分离。线上最关注引用准确率因为财税场景用户要求可溯源漏报比误报更敏感优先保召回。”详细介绍RAG流程重做有哪些优化为什么这么问流程题考察完整链路掌握优化题考察迭代能力和复盘能力是拉开差距的关键。回答侧重点流程一条线讲清每步输入输出优化必须因为什么所以改体现按数据决策。答案 流程解析清洗→按结构切分→稠密稀疏双路索引→混合召回RRF融合→cross-encoder重排→上下文组装带引用→生成。 重做的优化评测集先行——第一版没有评测集靠感觉调参切分按文档类型路由——表格和条款类策略分开query改写——口语化问题先改写再检索metadata过滤——年份、机构、文号不参与语义计算反馈回流——线上被否定的回答进bad case迭代。 最重要的改动是评测集没有它后面所有优化都无法验证。BGE-M3主要有哪3部分作用是什么为什么这么问纯知识题验证技术细节是否扎实RAG岗高频考点必须答全。回答侧重点三多全报——多语言、多功能、多粒度每个给一句话作用补一句三种表示如何配合。答案 BGE-M3是’三多’多语言100语言统一建模中英混合查询不用换模型多功能一个模型出三种表示——稠密向量dense语义召回、稀疏向量sparse可解释词权重接近BM25、多向量multi-vectorColBERT式后期交互精排更准多粒度最长支持8192 token长文档可直接编码。 用法上dense管语义、sparse管精确词、multi-vector管精排正好对应混合检索各环节。财税项目用ES做什么和BGE-M3的区别为什么这么问考察工具定位是否清晰能否区分检索基础设施和表示模型能否讲清互补关系。回答侧重点先定义层级再从匹配机制、擅长短板、部署成本、关系四方面对比给一个场景化例子。答案 “ES是检索基础设施BGE-M3是embedding模型不在一个层级。ES靠倒排索引BM25做字面匹配精确匹配、过滤、聚合强、成熟稳定短板是换个说法就搜不到BGE-M3做语义匹配同义改写、口语化提问能召回短板是专有名词、编号、数字区分度弱。 财税场景里两者互补而非替代文号、条款编号走ES精确匹配跨年度汇算清缴怎么处理’这类语义问题走BGE-M3双路召回RRF融合。”你有什么要问我的为什么这么问考察求职动机、主动性、思考深度是候选人唯一掌控主动权的环节。回答侧重点问岗位第一个项目、团队分工评测沉淀、业务瓶颈不问薪资福利细节和加班。答案 想问三个问题这个岗位进来后第一个要接的项目是什么目前团队RAG链路的评测集沉淀到什么程度了财税场景现在最大的瓶颈是数据质量还是模型能力学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进