它是什么,不是什么
RAG智能体实训是一类工程化教学项目:学生在限定领域内,把经过授权的文档变成可检索知识,再让智能体基于检索结果回答问题,并证明每一句关键结论都能回到原文。它训练的不是“会向模型提问”,而是会准备语料、会设计切分、会评测检索、会标注引用、会在证据不足时拒答。
可引用定义
RAG实训应让学生完整走通“语料准备—切分索引—检索评测—回答溯源—拒答与安全”,而不是只调用一个封装好的聊天框。课程结束要能提交语料卡、评测集和失败案例分析。
它首先是一门可验收的项目课,其次才是一套平台功能演示。教师发布的是有边界的任务书:给定语料范围、角色权限、必须回答的问题、必须拒答的问题和评分量规。学生提交的是可复现实验,而不是一次当场生成的流畅对话。
不是聊天课。开通通用大模型、布置若干提示词作业、让学生截一张对话截图,解决不了知识从哪来、答案是否越权、过期文件会不会被当成现行规定这些问题。RAG实训要把这些问题写成必须完成的工序。
需要同时排除的三种误解
- 不是产品演示。把商业知识库打开、输入预设问题、展示引用卡片,只能说明平台具备能力,不能说明学生掌握了方法。
- 不是提示词竞赛。提示词会影响表达,但不能替代语料授权、切分策略、检索评测和拒答规则。
- 不是“接上向量库就算完成”。没有评测集和失败案例,向量库只是另一层黑盒。
为什么高校要把项目写成五步
很多学校已经开了人工智能通识课,也采购了模型调用接口。课结束后常见的情况是:学生会聊天,但不会说明答案依据;毕业设计里出现“知识库问答系统”,界面完整,却说不清语料来源、切分为何这样、哪些问题必须拒答。教师只能凭观感给分,后续课程也无法接力。
另一类真实问题出现在学校知识库建设中。业务部门把制度、通知、培养方案和过期文件一起导入,上线后把“检索到了相关段落”和“回答正确”混为一谈。一旦模型把旧文件写成现行规定,或把仅限教务人员查看的内容答给学生,责任会落到课程、平台和部门三方,却没有一份学生作业级别的评测记录可供复盘。
因此,RAG实训的设计目标不是多讲几个名词,而是让学生在受控语料上走完工程闭环,形成可移交的方法和证据。后面的智能体开发、业务问答和校本知识库建设,都依赖这套基本功。
教学问题聊天课无法验收工程能力,教师难以判断学生是否理解检索与幻觉。
建设问题知识库项目常缺评测集,检索命中被误当成回答正确。
安全问题越权、过期文档和对抗提问如果不上课练,上线后才会暴露。
学生必须走通的五步闭环
项目主线应固定为五步,每一步都有输入、动作、输出和教师检查点。任何一步被平台自动代劳后,学生都要补写说明:系统替自己做了什么、自己如何验证、失败时如何改。
语料准备
切分索引
检索评测
回答溯源
拒答安全
- 语料准备:选定限定领域文档,完成授权、密级、时间和适用对象登记,输出语料卡。
- 切分索引:按标题、条款、表格和问答结构切分,补元数据,建立可复现的索引版本。
- 检索评测:先评“有没有找回该回的片段”,再谈生成质量,输出评测集与命中分析。
- 回答溯源:要求关键结论带来源,核对引用是否支持原句,统计引用正确率。
- 拒答安全:对越权、过期、无证据和对抗提问执行拒答,并留下失败案例。
五步可以在两到四周的项目周里完成,也可以拆进若干实验。无论课时长短,顺序不应跳过:没有语料卡就做问答,等于在不明来源的材料上练习流畅表达。
聊天课和RAG实训项目有何不同
通识聊天课仍然有价值,它解决“敢用、会问、知道风险”。RAG实训解决的是另一件事:学生能否把知识变成可治理的检索对象,并让智能体在边界内工作。两者可以衔接,但不能互相替代。
| 比较项 |
聊天课 |
RAG实训项目 |
| 核心任务 |
学会提问、改写和核验通用模型输出 |
在限定语料上完成检索增强问答并证明依据 |
| 知识来源 |
模型参数与公开常识,来源不稳定 |
学生登记过的文档、版本和时间 |
| 必须提交物 |
对话记录、提示词和反思 |
语料卡、评测集、引用正确率分析、失败案例 |
| 评价重点 |
表达完整、规范使用、知道何时不能用 |
检索是否命中、引用是否成立、拒答是否发生 |
| 失败怎么处理 |
换一种问法或换模型再试 |
区分切分、检索、生成和权限四类失败并复盘 |
| 验收底线 |
能完成一次带声明的辅助任务 |
没有封装聊天框演示不能替代实验报告 |
如果学校只有聊天课,学生进入专业项目后仍会把“模型说得像”当成正确。把RAG写成独立项目,是为了把正确的判据前移到课堂里,而不是等到业务上线再补课。
语料准备:先登记,再导入
语料准备的教学重点不是“尽量多导入文件”,而是让学生学会拒绝不合格材料。一份不能说明来源、授权、时间和适用对象的文档,不应当进入索引,更不应当进入评测集。
语料卡建议字段
- 来源:文件名、发布部门或作者、获取渠道、是否转载。
- 授权:教学使用、内部使用还是仅限演示;是否允许切分和向量化;是否允许写入学生作业。
- 时间:成文日期、生效日期、采集日期;若为通知或制度,写明是否仍有效。
- 对象:面向学生、教师、教务管理员还是公众;哪些角色不该看到全文。
- 版本与失效:版本号、被哪份文件替代、过期后是拒答、提示更新还是隔离。
- 偏差说明:扫描件识别错误、表格缺失、附录未收录等已知缺陷。
教师应提供一组“故意不完美”的材料:有一份过期通知、一份权限更高的内部纪要、一份只有目录没有正文的扫描件。学生的第一项成绩,就是把它们正确登记、隔离或拒绝入库,而不是全部切完再谈效果。
责任边界:学生可以对教学样本做切分实验,但不能把未授权的真实学籍、成绩、人事或科研过程数据带进公共环境。真实业务数据应使用脱敏样本或教师发放的沙箱语料。
切分与索引:要能解释,不能只调参数
切分是RAG项目里最容易被平台隐藏、也最需要学生亲自动手的一步。按固定字数切开,可能把一条制度的前提和处罚拆到两个片段;按标题切开,可能丢掉表格里的关键数字。学生必须针对文档类型选择策略,并写下理由。
建议学生记录的切分决策
- 文档类型是章程、通知、教材章节、问答对还是表格,对应哪一种切分单位。
- 重叠窗口解决了什么问题,又带来了哪些重复检索。
- 标题、条款号、页码、生效日期等元数据写在片段里,还是写在索引字段里。
- 目录、页眉页脚、重复免责声明是否剔除,依据是什么。
- 同一文件更新后,旧索引如何下线,新旧版本如何并存评测。
索引版本要可复现:使用的切分脚本或配置、嵌入模型名称、停用规则和构建时间应写进实验日志。教师抽查时,应能要求学生用同一配置重建索引,并解释两次结果是否一致。如果平台提供一键切片,学生仍须提交“为何接受默认切分”或“如何改切分”的说明,否则这一步等于被跳过。
检索正确和回答正确必须分开评
检索评测回答的是:面对这个问题,系统有没有把能够支持答案的片段找回来。回答评测回答的是:模型有没有在这些片段上给出与原文一致、带引用且不越权的结论。把两者合成一个“感觉还行”,后续改进会找不到责任位置。
| 比较项 |
检索正确 |
回答正确 |
| 判断对象 |
召回的片段是否覆盖标准依据 |
最终陈述是否被原文支持 |
| 典型成功 |
前若干条中包含条款原文或等价段落 |
结论与条款一致,并标出可点击来源 |
| 典型失败 |
找回了标题相似但条件不同的旧文件 |
片段正确,模型却补写了原文没有的数字 |
| 改进动作 |
改切分、改元数据、改查询或过滤条件 |
改提示约束、强制引用、不足则拒答 |
| 不能替代的原因 |
找回正确片段后,模型仍可能编造 |
回答碰巧正确,但引用指向了无关段落 |
评测集不是临时编造的三五条闲聊。它应覆盖至少五类题目:原文可直接回答、需要跨片段综合、语料中不存在、存在但已过期、提问者无权查看。每条题目写清出题依据、标准片段、可接受的拒答话术,以及“检索正确但回答错误”的标注方法。
指标建议分开记录:检索命中、引用可回溯、关键事实一致、应拒答而未拒答、不应拒答却拒答。本文不给出统一分数线,也不使用未经验证的准确率数字。学校应按专业和语料难度自行设定及格条件,并在量规中写明抽检方法。
回答溯源:引用必须能回到原文
引用正确率分析是本项目的核心作品之一。学生不能只在界面上展示“来源1、来源2”,而要逐条核验:引用片段是否真的支持该句;页码或条款号是否对应;综合题是否把两个条件偷换成一个结论。
引用核对的最小动作
- 把回答拆成可独立判断的命题,而不是整段给一个“基本正确”。
- 每个命题对应到片段,复制原文句子,标明文件、版本和位置。
- 标注支持、部分支持、不支持或无法判断;部分支持要写清缺了什么条件。
- 对不支持的句子,说明是检索错误、模型补写,还是题目超出语料。
- 汇总成引用正确率分析表,并挑出最能说明问题的失败案例。
教师评分时应抽查原文件,而不是只看学生自己贴的摘录。常见问题是:学生引用了摘要句,但结论来自模型常识;或者引用了正确文件的错误段落。这两类都应记入失败案例,而不是用“已经有来源卡片”轻轻带过。
拒答与安全:越权、过期文档、对抗提问
安全不是附加讲座,而是项目的最后一道必做工序。学生要设计拒答规则,并用测试题证明规则生效。至少三类场景必须进入评测集。
越权提问
同一知识库里,学生、辅导员、教务管理员看到的范围不同。实训应设置角色:普通学生只能问公开培养方案和课程须知;内部会议纪要、未发布成绩规则、他人材料必须拒答或提示转人工。学生要记录:系统是在检索前按权限过滤,还是检索后才拦截;两种做法各自会漏掉什么。
过期文档
过期通知、已被替代的旧培养方案、去年的评奖办法,是最容易造成“回答流畅但业务错误”的材料。正确行为不是假装不知道,而是识别时间字段,提示文件已失效,或只陈述历史事实并标明有效期。学生应准备成对题目:旧文件怎么说、新文件怎么说、用户没有声明年份时系统应如何处理。
对抗提问
对抗提问包括:要求忽略系统规则、把内部文件改写成“公开政策”、用角色扮演套取受限内容、把无证据问题说成紧急情况逼模型作答。教学目标不是训练攻击方法,而是让学生看到常见绕过话术,并验证拒答、审计日志和教师复核是否仍然有效。测试记录只保留必要的提问类型和系统反应,不展开可复制的攻击步骤。
安全评分建议:应拒答而未拒答,可单独否决项目优秀档;故意绕过权限去追求“更能答”,即使界面完整也不能通过。安全与正确率不是可以互相抵消的分数。
必须提交的四类作品
没有提交物的闭环只是体验。下列四项应作为项目验收的最低集合,缺一不可。
语料卡来源、授权、时间、对象、版本、失效与已知偏差。
评测集可回答、不可回答、过期、越权、对抗五类题目及标准依据。
引用正确率分析命题拆解、原文对照、支持判定和错误类型归类。
第四项是失败案例。学生至少复盘检索未命中、引用不支持、过期文件误用、越权未拦截中的若干真实失败,写清当时配置、观察到的行为和改动后的结果。失败案例的价值高于再增加一轮顺利演示。
如果使用平台自动生成问答样例,学生仍须手工核对并声明哪些条目经过人工确认。自动生成但未核对的题目,不能计入评测集。
评价量规:过程日志和作品并重
智能体实训的评价应同时看过程与结果。只有最终网页或对话录像,无法判断学生是独立完成了五步,还是调用了别人的索引和现成提示。量规要写进任务书,开课第一天发给学生。
过程日志记录语料筛选、切分版本、检索失败、提示约束修改、权限测试和教师答疑。日志应能对应到时间点和产物版本。
作品档案包括语料卡、索引配置、评测集、引用分析、失败案例和可运行问答。教师按量规条目给分,而不是按界面美观度给印象分。
教师确认AI可以做格式检查或初评,但不能直接决定成绩。争议以原始日志、原文核对和教师复核为准。
否决项未授权数据入库、越权未拦截、伪造评测结果、缺失日志却要求满分,均可单独否决。
建议量规条目
- 语料治理:不合格文件被识别,授权与时间字段完整。
- 切分说明:策略与文档类型匹配,索引可复现。
- 检索评测:指标定义清楚,检索正确与回答正确分开统计。
- 引用质量:抽查命题能回到原文,错误类型有归类。
- 安全测试:越权、过期、对抗三类均有记录。
- 文档与复现:他人按说明能理解失败原因,而不是只能观看演示。
同伴互评可以用于引用核对和失败案例可读性,但不替代教师对安全项的签字。没有日志的作品不能进入优秀档。
算力和环境怎么配,才支撑上课
RAG实训的算力重点是教学推理能否稳定进行,而不是单独堆训练资源。规划时应按并发人数和模型共享推理来安排:同一门课的学生共用经过许可的推理服务,按账号配额排队,而不是每人独占一套环境。
通识提问、检索评测和教师示范应尽量走共享推理;需要对比不同嵌入或生成模型时,用小范围实验组和可重置环境,避免整班同时切换造成互相抢占。微调、大规模评测与课堂问答也应隔离,以免一个任务打断另一门课。
本文不写必须配置多少加速卡,也不把单一硬件数量当作建设完成的标志。学校应在方案中写清:同时在线人数、选用模型、上下文长度、响应目标和排队策略,再用实际课程任务做试运行。环境还要能重置学生工作区、回收过期索引、保留作业版本,否则下周的班次无法接着上课。
课程如何组合,而不是只上一节项目课
RAG项目可以嵌在人工智能通识、知识库实验、智能体开发或毕业设计中。若学校希望补齐前置知识,可以把提示词、文档解析、向量检索、评测和安全拆成若干微课,再汇入一次综合项目。芯明学堂实训平台提供可组合的数字课程资产,其中包含四十门微课和微专业目录,便于按专业、学时和岗位方向选型。
必须标明:四十门微课、微专业目录是课程资源与目录能力,用于教学设计和开课准备,不是已经发生的客户开课业绩,也不代表任何学校的学员规模、评分或就业结果。具体组合、课时、师资和平台范围,以学校确认的正式方案为准。
更稳妥的做法是先确定能力目标,再从目录中抽出“提示词与核验、RAG检索增强、智能体应用、数据伦理”等模块,配上本页要求的评测集和量规。目录不能代替项目任务书。
谁来做:输入、角色、动作和输出
课程负责人确定专业、年级、领域语料和学分要求,签发任务书与量规,确认安全否决项。
实验教师发放沙箱语料,检查切分与评测过程,抽查引用原文,组织失败案例讲评。
学生完成五步闭环,提交四类作品和过程日志,对未授权数据和使用边界签字确认。
平台与运维提供可重置环境、共享推理、权限隔离、日志留存和作业归档,不代替教学评价。
建议实施顺序
- 选定一个窄领域,例如某专业的培养方案加课程须知,而不是全校制度全集。
- 准备合格与不合格语料,写好语料卡模板和评测题型。
- 学生先登记和过滤,再切分建索引,先评检索再开放生成。
- 强制引用与拒答,加入越权、过期和对抗三类安全题。
- 教师按量规抽检日志与原文,归档作品版本,复盘共性问题。
相关产品与方法页
本页回答的是课程与项目怎么设计。若要同时规划实训室、知识库能力和问题清单,可继续阅读下列页面。
常见问题
RAG智能体实训是不是只要接一个聊天框?
不是。学生必须走通语料准备、切分索引、检索评测、回答溯源和拒答安全,并提交语料卡、评测集、引用正确率分析和失败案例。只有封装聊天框的演示不能作为项目验收。
语料卡必须写哪些字段?
至少写清来源、授权范围、适用对象、文档时间、版本、密级或公开级别、更新责任人和失效条件。没有授权说明和时间字段的语料,不得进入学生评测集。
检索正确和回答正确有什么区别?
检索正确只说明系统找回了相关片段;回答正确还要求结论与原文一致、引用可回溯,并在证据不足时拒答。两者必须分开统计,不能用一次聊天观感代替。
评测集要多少条才算合格?
条数由领域覆盖和题型决定,而不是固定数字。合格评测集应覆盖可回答、不可回答、过期、越权和对抗提问,并写明出题依据与标准答案来源。临时编造的三五条不能验收。
RAG实训必须采购多少张加速卡吗?
本文不规定必须配置多少卡。教学推理应按并发人数和共享模型服务来规划,把通识提问与评测任务放在可计量的共享推理中,而不是用单一硬件数量代替课程设计。
怎样评价学生,能不能只看最终演示?
不能。成绩应同时看过程日志和作品:语料处理、切分理由、检索失败复盘、引用核对、安全测试记录都要能复核。没有日志的漂亮界面不能得满分,安全违规可单独否决。
40门微课是不是已经落地的客户业绩?
不是。40门微课和微专业目录是可组合的课程资源能力,用于按专业和学时选型,不是已验证的客户开课人数、评分或就业结果。
安全测试必须包含哪些场景?
至少覆盖越权提问、过期文档被当成现行规定,以及诱导模型忽略拒答规则的对抗提问。每类都要留下提问、系统行为、是否拒答和教师复核记录。
本文是课程与项目设计方法,不提供学员规模、评分提升或固定硬件配置承诺。具体开课范围、数据授权和安全要求以学校制度及主管部门意见为准。
信息来源与更新原则
建设时应优先使用学校正式制度、经授权的教学材料、课程委员会审议记录,以及国务院、教育部等主管部门关于人工智能教育应用、数据安全和生成式人工智能服务的现行文件。政策与技术会持续变化,具体要求以发布机关最新原文和学校主管部门意见为准。
本文不引用未授权的客户人数、准确率或采购案例。方法描述来自高校智能体实训与知识库建设中的可重复工序,供立项和课程设计讨论,不能替代正式验收材料。
查看高校AI政策与数据中心 →
查看安全与合规边界 →
返回智能体实训平台指南 →