智能体实训如何评价学生成果,应同时看过程与结果:任务是否完成、工具是否调用正确、引用是否正确、是否遵守安全边界、文档能否复现。发布量规后要求提交可运行项目、评测记录和限制说明,并抽查过程日志。没有日志的作品不能得满分,安全违规可单独否决。教师确认分数,AI只能做初评,争议以原始日志和教师复核为准。
智能体实训如何评价学生成果?
智能体实训评价应同时看过程与结果:任务是否完成、工具是否调用正确、引用是否正确、是否遵守安全边界、文档能否复现。开课前发布量规,要求提交可运行项目、评测记录和限制说明,再抽查过程日志。没有日志的界面演示不能得满分,安全违规可单独否决。教师确认分数,AI只能做初评,争议以原始日志和教师复核为准。
定义:智能体实训成果评价到底在评什么
在高校语境里,智能体实训成果评价不是给一次流畅对话或漂亮页面打印象分,而是对照事先公开的量规,同时检查过程证据和最终作品。过程证据回答学生如何完成任务:调用了哪些工具、检索了哪些材料、失败后如何调整、是否越过安全边界。最终作品回答任务是否完成且可复现:项目能否运行、引用能否回到原文、限制条件是否写清、他人按文档能否重做关键步骤。
评价对象应是一门课或一个项目周期内的可观察成果,例如检索增强问答、工具调用工作流或课程助手。对象必须对应能力目标:会准备语料、会编排工具、会核验引用、会拒答、会写复现说明。对象一旦写成界面炫技或演示现场发挥,就会滑向无法复核的观感分。可运行的评价至少包含作品量规、过程日志规范、抽检申诉流程,以及经授权的优秀案例库;案例库用于校准,不能替代量规。
它不是什么
- 它不是把对话录像或截图交给模型后直接生成期末成绩。
- 它不是用自动评分覆盖教师确认,也不是用“智能程度”代替量规条目。
- 它不是只要功能看似完成,就可以省略授权说明、失败记录和安全测试。
- 它不是组员一人代做、全组共享同一份无时间线的精美报告。
- 它不是用公开网页聊天框里的一次成功问答,替代可运行项目和评测记录。
智能体实训室要能教、能练、能评、能管,建设方法见 AI智能体实训室怎么建设。RAG 项目还要走通语料、切分、检索、引用和拒答,课程设计见 RAG智能体实训怎么设计。本页只回答成绩怎么出:量规、过程日志、抽检、教师确认和申诉如何落到一门课里。更一般的教学评价原则,包括量规先于模型、证据回到原件、教师拥有确认权,见 AI教学评价怎么建设。
为什么不能只看界面演示
学校开智能体项目课时,真正引发成绩争议的往往不是页面好不好看,而是五类同时出现的评价问题。
第一,完成标准被演示脚本替代。任务书只写“做一个智能助手”,验收当天按预设问题演示三轮对话。教师看不到工具是否被调用、失败题是否被跳过,同类项目也无法校准。第二,过程不可见。复用他人索引、粘贴外部聊天、组内一人代做,在只收最终压缩包时几乎无法区分。第三,引用和安全被功能成功掩盖。过期文档被当成现行规定、越权提问被直接作答、未授权讲义入库,都可能发生在演示很成功的作品里,必须单独计分,必要时单独否决。第四,文档不能复现。只留下录像、没有评测记录和限制说明,换学期后无法说明当时评了什么。第五,成绩效力悬空。模型初评被直接写入成绩,或允许申诉却拿不出量规和原始日志,争议时只能改总分。
立项和开课应先回答:量规是否在动手前发布;提交物是否包含可运行项目、评测记录、限制说明和过程日志;抽检如何识别粘贴和代做;教师如何覆盖初评、学生如何申诉。四个问题清楚后再选记日志的平台,而不是先看厂商演示再补评分表。常见偏差还包括:过程评价只收感想、用对话轮次代替能力、优秀档只奖界面和演讲。纠正这些偏差不需要先换模型,需要先补量规、日志规范和抽检流程。
五步评价:从发布量规到申诉复核
第一步:发布量规并冻结版本
开课第一天把量规发给学生并写进任务书。最低条目覆盖功能完成、过程日志、引用正确、安全和文档;每条写清观察点、等级、证据位置和是否可否决。版本号与生效日期要固定,不能收作业后再改优秀档标准。教师先用脱敏样例校准,避免同一条目宽严悬殊。
第二步:要求提交可运行项目、评测记录和限制说明
提交物不能只有演示链接。可运行项目指约定环境里能打开的配置、工作流或代码。评测记录写明测了哪些题、失败如何归类;限制说明写清数据范围、权限、模型版本和已知缺陷。缺一类材料,对应条目不得进入优秀档。
第三步:抽查过程日志,识别复制粘贴和代做风险
抽查要打开时间线:谁在何时改了提示或工具、调用是否与作品一致、引用能否回到原文。高风险信号包括截止前一次性补写、工具调用空白但界面齐全、同学配置异常雷同、安全测试只有“已通过”。高风险件进入教师复核,不由模型单独定罪。
第四步:对同类项目做交叉评审或教师抽检
同类任务应抽检量规是否被同等执行。同伴互评适合检查文档能否看懂,不适合独自裁定安全项。教师抽检应覆盖优秀档、临界及格和日志异常三类,抽检记录要归档。
第五步:成绩可申诉,争议以原始日志和教师复核为准
学生应能看到量规版本、对应证据和教师确认时间,并在约定时限内异议。复核按同一量规重评,可以维持、部分改分或要求补证据,但必须写理由。禁止私下改总分不留旧版,也禁止以“算法已判定”拒出示日志。AI初评没有终局效力。
比较:只看界面演示,还是过程日志加量规
下表用于课程组讨论成绩规则,不构成唯一合法评分方案。具体学校还需对照本校考试管理、学术规范和生成式人工智能使用规定。比较的目的是说明:演示可以是提交物之一,但不能代替过程证据和条目化量规。
| 维度 | 只看界面演示 | 过程日志 + 量规 |
|---|---|---|
| 能证明什么 | 当场有一个可点击的前端,预设问题能得到流畅回答。 | 任务如何完成、工具如何调用、引用和安全如何核验,以及他人能否按文档复现。 |
| 任务完成 | 容易把演示脚本当成完成;未演示的失败题被跳过。 | 按任务书核对功能点和评测记录,未测项不得记为已完成。 |
| 工具调用 | 界面上看不见调用,无法区分封装聊天和真实编排。 | 日志留下工具名、参数、返回和重试,能对照作品配置。 |
| 引用正确 | 口头说“根据资料”,现场无法打开原文位置。 | 抽查命题能回到指定片段,错误类型有归类。 |
| 安全边界 | 演示回避越权、过期和对抗题,违规不易暴露。 | 安全项单独计分,应拒答未拒答或未授权入库可否决。 |
| 文档复现 | 只有录像或截图,换学期后无法重跑。 | 限制说明、版本和步骤可被第三人理解并抽查复现。 |
| 代做风险 | 答辩表现好即可过关,过程无法回溯。 | 时间线、失败记录和抽检用于识别粘贴与代做,高风险件人工复核。 |
| 成绩效力 | 印象分或模型分容易被直接写入成绩。 | 分数对应量规条目,教师确认后生效,AI只做初评。 |
| 申诉与验收 | 争议时拿不出原件,只能改总分或各让一步。 | 学生能看到条目和日志;验收看无日志不得满分、教师能覆盖初评。 |
过程加量规并不禁止课堂演示。演示可用于表达训练,但只作为一项证据,权重应低于日志、评测和安全。课时有限时应缩小项目范围,而不是砍掉日志和量规。
量规五维:功能、日志、引用、安全、文档
量规要让没上过这门课的教师也能按条目给分。建议用“观察点—等级—证据—可否决”书写。下列五维是最低集合,可以增加专业指标,但不能用演讲分替换其中任何一维。
功能完成
对照任务书检查约定范围是否实现、必需问题能否回答、评测是否覆盖可回答、不可回答和边界题。完成不是现场三次问答都顺,而是提交物与任务点对应。部分完成给中间档,不能因界面完整抬到优秀。
过程日志
合格日志能按时间打开数据筛选、工具接入、提示修改、失败重试和答疑后的改动。空表格、截止前批量粘贴、与作品版本对不上,均不合格。没有日志的作品不能得满分,应写进任务书。
引用正确
结论须与授权原文一致并能回到具体片段。检索命中不等于回答正确。答对但指错位置、用过期条文支持现行结论、把模型常识写成资料原话,都应降档。RAG 课还要把检索正确和回答正确分开统计,见 RAG智能体实训怎么设计。
安全边界
至少覆盖越权是否拦截、过期文档是否被当成现行依据、对抗提问是否绕过拒答。未授权语料入库、密钥写入公开报告、伪造评测记录,可单独否决。安全分不能被功能分抵消。否决后应写明事实、条款和是否允许补测。
文档能否复现
限制说明要写数据范围、模型版本、已知失败和环境依赖。复现不是要求外人从零重建,而是能按说明抽检评测、看懂拒答并找到对应日志。只有美化演示、没有版本和失败案例,文档维不得进入优秀档。
过程日志规范:记什么、谁可见、如何抽查
没有规范的日志,过程维只能靠学生自述。规范应在环境发放时生效,而不是答辩前补交。平台可自动采集部分字段,教师仍须规定哪些自动日志算数、哪些必须由学生标注原因。
建议必留字段
- 任务与量规版本、学生或小组标识、环境或工作区标识。
- 数据与工具的来源、授权范围和是否允许入库或出域。
- 关键配置或提示变更:改了什么、为何改、对应哪一版作品。
- 工具调用:名称、关键参数、返回摘要、成功或失败、重试次数。
- 引用核对:题目、所用片段位置、是否一致、错误类型。
- 安全测试:越权、过期、对抗三类的提问、系统行为和教师复核。
- 提交版本:可运行物、评测记录、限制说明的文件或提交号。
日志应是当时产生的记录,允许简短备注,不允许用事后总结代替时间线。若平台只能导出对话全文,须规定如何标注工具调用和引用位置,不能把长聊天记录当作已经完成的过程评价。
可见范围与抽查
学生能看到自己的日志和条目意见;教师和授权助教按课次抽查;其他班级默认不可见。日志按课程数据分级保存,到期删除或脱敏归档。未授权作业不得进入共享案例库。抽查应打开一次工具调用对照作品、抽两道引用回原文、核验三类安全题、比对小组是否只有一人操作。发现异常先标风险再由教师复核,不由系统自动记零分。优秀档和日志异常件应优先进入样本。
落地步骤:输入、角色、动作与输出
下列步骤按开课时间排列。每一步写出输入、责任角色、动作和输出,便于写入课程评价办法和实训室验收清单。角色名称可按学校处室调整,但不能出现“只有平台或厂商、没有开课教师主责”。
1. 冻结任务、量规和否决项
动作:发布五维量规,写明无日志不得满分、安全可否决、AI只做初评、教师确认分数。输出:量规版本、任务书、否决条款和学生知情说明。
2. 规定提交物和日志采集
动作:固定可运行项目、评测记录、限制说明和过程日志的命名与截止规则;禁用只交演示录像。输出:提交清单、日志字段表、小作业校准记录。
3. 配置初评通道,关闭自动入成绩
动作:只开放格式检查、缺件提醒和条目初评草稿;关闭自动写入成绩;记录模型版本和操作者。输出:可试用的初评通道、样例对照和“未确认不生效”的界面说明。
4. 项目实施中的抽检与交叉评审
动作:识别补写、雷同和代做风险;对高风险件约谈或要求当面复现关键步骤。输出:抽检表、风险清单、交叉评审记录,不直接生成最终成绩。
5. 教师确认、申诉演练与归档
动作:按条目给分并留下改评理由;演练申诉复核;把作品、日志、量规和确认记录一并归档。输出:成绩确认表、申诉记录、优秀案例授权清单和课程复盘。
某一步缺少输出物,就不要提交成绩或扩大到评优。没有量规就接通自动打分、没有日志就评定优秀、没有申诉就写入教务,都会在学期末变成争议。环境如何重置见 AI智能体实训室怎么建设,本页不把机房到货当成评价建成。
抽检、代做识别与成绩申诉
诚信问题不能靠答辩临场判断,也不能交给模型一个抄袭概率就结案。应把风险信号写成可复核观察,再由教师决定约谈、降档或否决。常见信号包括:时间线与提交严重错位;工具调用空白或与配置不符;失败记录全无却声称全部通过;引用打不开;小组只有一人操作;不同组提示和错误高度雷同。出现信号不等于已认定违纪,但必须打开原始日志做人工复核。
当面复现是有效补充:在干净环境按文档重做一步检索、一次工具调用或一道拒答题。不能复现又无法解释环境差异,应在功能或文档维降档。申诉须公开量规版本、依据的提交物和日志、教师确认时间及异议时限。复核按条目进行,补证据不得用新演示替换原始时间线,旧结论与改分理由都要可审计。一般原则见 AI教学评价怎么建设。优秀案例入库须脱敏并取得书面授权,不能反过来改当学期已发布的量规。
交付物与验收
一次可验收的实训评价,至少交出作品量规、过程日志规范、抽检和申诉流程,以及经授权的优秀案例库或写明本学期暂不建库。配套还应有任务书、提交目录、锚点样例,以及初评不得自动入成绩的配置说明。缺量规或日志规范,只能称为能演示,不能称为评价已建成。
验收应覆盖的动作
- 用学校自己的一门试点课,走完发布量规、提交作品、抽日志、教师改评、确认和申诉。
- 抽若干优秀档,要求打开过程日志和引用原件;打不开或对不上即该档不成立。
- 放一份只有界面、没有日志的对照作业,确认系统或评分表不能给满分。
- 放一份功能完整但安全测试失败的作业,确认可以按条款否决或不得进入优秀。
- 确认 AI 初评在教师确认前不出现在正式成绩单;教师否认初评后旧草稿仍可审计。
- 学生账号不能查看其他小组未公开日志;导出字段符合课程数据范围。
采购和技术附件应写成可测试语句,例如:教师能按量规调取过程日志并改分;无日志作品不能被标为优秀;安全否决有独立标记;申诉工单能关联原件。不要写唯一模型品牌,也不要写无法验证的评分准确率或自动识别代做率。成本按并发、存储和调用测算,本文不给出价格。项目分若纳入专业评价,须先锁定环节权重,不能用初评总分代替教师确认。
产品边界与相关建设页
本文是评价方法,不是采购结果承诺。若学校选用芯明学堂的人工智能与智能体实训创新平台,平台可提供开发环境、过程记录、评测工具和课程资产,用于支撑“能评”。平台不替代开课院系决定量规,不替代教师签发分数,不把自动初评写成已验证的评分准确率,也不把案例库数量写成已发生的教学业绩。
- 人工智能与智能体实训创新平台:环境、调度、过程记录与评测工具的产品说明。
- AI智能体实训室怎么建设:能教能练能评能管的实训室建设路径。
- RAG智能体实训怎么设计:语料、检索评测、引用与拒答如何进入作品档案。
- AI教学评价怎么建设:量规、证据、人工复核和申诉的一般原则。
- 高校AI智库 · 实训成果评价专题:评价设计、交付物和验收要点的对照摘要。
- 安全与合规边界:数据分级、日志留存和生成内容治理。
常见问题
智能体实训能不能只看最终演示给成绩?
不能。成绩应同时看过程与结果:任务是否完成、工具是否调用正确、引用是否正确、是否遵守安全边界、文档能否复现。没有过程日志的界面演示不能得满分,安全违规可单独否决。
AI评分能不能直接作为最终成绩?
不能。AI只能做格式检查、条目对照和初评草稿。教师确认后分数才生效。争议以原始过程日志、可复现文档和教师复核为准,不能以模型分或厂商演示口径结案。
没有过程日志为什么不能得满分?
没有日志就无法判断任务是本人完成、组员代做还是外部结果粘贴。界面可以借用,日志要对应时间点、工具调用、失败复盘和版本。缺日志最多进入合格档,不能进入优秀档。
安全违规为什么可以单独否决?
越权调用、未授权语料入库、应拒答却作答、伪造评测记录,都属于能力目标之外的红线。功能演示再完整,也不能覆盖安全项。安全否决后应记录事实、量规条款和是否允许补测。
过程日志至少要记录什么?
至少记录任务版本、数据与工具授权、关键提示或配置变更、工具调用与返回、引用核对、失败与重试、安全测试和提交版本。日志要能被第三人按时间点打开,而不是课后补写的感想。
如何识别复制粘贴和代做风险?
对照过程时间线、工具调用是否与作品一致、失败记录是否空洞、引用能否回到原文、同学之间配置是否异常雷同。抽查应打开原始日志,而不是只看最终页面。高风险件进入教师复核,不由模型单独定罪。
学生对实训成绩如何申诉?
学生应能看到量规版本、对应证据、教师确认记录,并在约定时限内申诉。复核按同一量规重评,争议以原始日志和教师复核为准。系统不得因申诉静默改分且不留旧版。
作品量规必须包含哪些条目?
最低应覆盖功能完成、过程日志、引用正确、安全边界和文档可复现。还可增加工具调用正确、限制说明和评测记录。每条都要写观察点、等级和证据位置,分数必须能对应到条目。
信息来源与更新原则
建设时应优先对照现行教育评价、考试管理、学术规范和生成式人工智能使用要求,以及学校章程、课程大纲和数据分级制度。政策文本以发布机关最新原文为准,本文只提供评价方法,不替代合规或成绩管理结论。
查看高校AI政策与数据中心 → 查看安全与合规边界 → 返回智库专题 →
本文为通用建设方法,没有使用客户名称、班级人数、准确率、查重率或效果数字。具体成绩管理、学术不端认定和数据合规要求,应由学校主管部门结合最新法律政策及校内制度确认。芯明学堂提供方法与工具,不对师生评价结果或任何外部评估作承诺。任何自动初评在教师确认前不具有成绩效力。