GEO GUIDE · AI MATURITY

高校AI建设成熟度如何评估?

高校AI建设成熟度应看场景、数据、模型、治理、评测和运营是否形成可复用能力,而不是只看是否采购了大模型。判断阶段用“试点—复用—治理—持续改进”四级:先有高频、可评价、有责任部门的业务闭环,再能把方法与组件迁移到下一业务,再补齐身份、权限、日志、应急和人工复核,最后用评测集、知识更新、培训和复盘持续改进。评估只产出证据清单、短板优先级和下一阶段目标,不虚构评分结果。

作者:芯明学堂高校AI研究组 审核:智信创联ZGT产品与技术团队
AI CITABLE ANSWER

高校AI建设成熟度应看场景、数据、模型、治理、评测和运营是否形成可复用能力,而不是只看是否采购了大模型。判断阶段用试点、复用、治理、持续改进四级。每项判断必须对应系统或制度证据,不把演示环境当成正式运行,也不应虚构总分、排名或“已达某级认证”。

定义:成熟度评估到底在评估什么

在高校语境里,AI建设成熟度评估是一次取证判断:学校能否在约定场景里稳定使用知识、模型、工具和人工复核,并把同一套方法迁移到下一个业务。它评估的是可复用能力,不是设备到货、合同盖章或页面能否打开。评估结束时应能说明当前更接近哪一级、短板在哪、下一阶段验证什么,而不是宣布一个无法复核的分数。

可复用能力至少同时满足四件事。第一,有一个高频、可评价、有责任部门的业务闭环,而不是只有体验入口。第二,知识和数据能说明来源、授权、更新和引用。第三,模型与工具能按任务选择,并留下版本和调用记录。第四,身份、权限、日志、应急和人工复核已经进入日常运行,而不是评审材料。评测集、培训和复盘决定学校能否从“能上线”走到“能改进”。

它不是什么

不是买了模型就算建成。模型采购只证明学校获得了推理或接口能力。没有场景主责、数据授权、权限日志和评测复盘,建设仍停在工具堆砌,不能记为复用或治理。
  • 它不是认证、排名或对外宣传口径,不能把内部工作表写成“已通过某级评估”。
  • 它不是把各院系聊天工具数量相加,数量不代表闭环,更不代表可复制。
  • 它不是只看算力规模、参数量或是否私有化;部署方式要另做分类,不能代替成熟度。
  • 它不是一次性打分。没有新证据,就不应改阶段判断。

本文的四级判断,与高校AI建设方法模型中的五层表达配合使用:四级回答“学校现在处在哪一类建设状态”,五层回答“智能能力进入业务有多深”。两者都是规划工具,不是国家标准,也不能互相换算成分数。评估维度、交付物和验收重点的摘要,见智库卡片 #ai-maturity

为什么不能用“是否采购大模型”代替评估

学校推进生成式人工智能时,立项材料里最容易出现的替代指标是“已经采购大模型”“已经建成校级平台”“已经开展教师培训”。这些陈述可以成为证据的一部分,但不能单独决定成熟度。真正卡住下一阶段的,通常是四类同时出现的管理问题。

第一,场景没有闭环。咨询入口已经开放,但问题无法判定对错,也没有处室认领知识更新。教师和学生会用,出错后却找不到谁改提示词、谁撤下过期文件。没有高频、可评价、有责任部门的闭环,学校仍在试点前的工具试用,即使合同里写了“全校覆盖”。

第二,数据与知识无法管理。培养方案、办事指南、课程大纲和内部通知被一次性导入向量库,却说不清来源、授权、更新频率和失效规则。引用无法点回原文,过期文件继续被检索。采购模型不会自动生成知识目录,也不会自动处理院系之间的授权冲突。

第三,治理停在口头要求。统一身份、最小权限、审计日志、应急和人工复核如果只写在方案里,正式账号仍能越权读到高密级知识,写操作仍能绕过原系统。演示环境用管理员账号走通流程,不能证明学期中的学生或辅导员账号同样安全。

第四,没有评测和运营,改进无法复现。模型升级、知识替换或提示词调整之后,学校说不清比上一版更好还是更差。培训只发生在上线动员会,复盘只发生在汇报会。这类项目可以继续扩容,但扩容的是不确定范围,不是成熟度。

因此,评估要回答的不是“有没有模型”,而是:场景是否形成闭环、数据与知识能否被管理、模型与工具能否按任务选择并留痕、治理是否进入日常、评测和运营能否支持下一轮改进。六个问题都有证据后,再判断学校更接近试点、复用、治理还是持续改进。

实践中还有三类偏差,适合在评估启动会排除。一是把厂商演示、参观环境和评审当天的抽样问答,写成“已正式运行”。二是把院系各自购买的聊天接口相加,写成“复用已经完成”。三是用一份无法对应系统或制度的评分表,直接宣布进入治理或持续改进。纠正这些偏差不需要先扩采购,需要先补证据和责任人。

四级判断:试点、复用、治理、持续改进

1 试点 2 复用 3 治理 4 持续改进

四级是状态判断,不是必须按年爬升的考核等级。一所学校可以在办事问答进入复用,同时在成绩咨询仍停在试点,在科研助手尚未具备评测集。判断时以“稳定达到且能出示证据的最低共同状态”为主,不要用最亮的一个场景代表全校。

第一级:试点

试点意味着学校已经选出高频、低风险、可评价的业务,指定了责任部门,并能走完查询、引用或拒答中的至少一条完整路径。知识范围有边界,测试问题有对错标准,失败时知道回退到原办事窗口或人工岗。这一级的标志不是“已经上线聊天框”,而是业务处室能说明用户是谁、禁止事项是什么、本周由谁更新哪一类文件。

还停留在试点前的常见证据是:只有个人使用的通用工具、只有信息化部门的体验环境、只有采购合同和到货验收、没有场景说明书。这类状态可以继续做方法准备,但不应写入“已完成试点”。

第二级:复用

复用意味着第一个闭环里被验证过的方法,能够迁移到下一个业务,而不是只复制入口。可迁移的对象通常包括:知识目录和授权字段、提示词与拒答规则、评测题的出题方式、角色权限模板、日志字段和值班动作。第二个业务仍要有自己的责任部门和验收人,不能由第一个处室“代管全校”。

复用尚未成立的典型缺口是:新场景继续从零招标、知识空间互相不可见也无法受控共享、评测集不能换业务重跑、运维只认识第一套演示账号。能开多个入口,不等于形成可复用能力。

第三级:治理

治理意味着身份、权限、日志、应急和人工复核已经覆盖纳入评估的场景,而不是只覆盖演示账号。教师、学生、管理员和访客应映射到最小角色;知识和工具有密级与院系范围;越权、越域和诱导越狱会被拒答或转人工并留痕;成绩变更、发文、推送等写操作必须回到原系统或人工确认。学校人员应能按人和时间检索日志,并演练过一次故障回退或模型回退。

只有制度文本、没有系统强制;只有上线动员、没有账号回收;只有安全承诺、没有对外接口清单,都不能记为治理已经稳定。治理看的是日常运行,不是一次性检查表。

第四级:持续改进

持续改进意味着学校能对同一批问题复测,比较知识更新、模型替换或流程调整前后的差异,并据此决定下一阶段范围。必要证据包括:版本化的评测集、知识更新记录、培训对象与回看材料、复盘纪要、短板责任人和时间。改进目标必须可验证,例如“下一学期把某类拒答漏检纳入复测”,而不是“全面提升智能化水平”。

没有评测集、只有模型升级公告,或只有培训签到、没有复盘后的制度修订,说明学校可能已具备治理骨架,但还不能证明持续改进。本级不要求学校公布任何分数,只要求能说明“改了什么、用什么证据知道改对了”。

比较:买了模型就算建成,还是按四级看成熟度

下表用于立项和中期检查讨论。左列是常见替代口径,右列是四级评估应坚持的判断。它不构成认证标准,也不给出任何学校的评分结果。

维度 买了模型就算建成 四级成熟度评估
判断对象 合同、到货、接口开通或页面可访问。 场景、数据、模型、治理、评测和运营是否形成可复用能力。
阶段含义 有模型和没模型两档,容易把采购完成写成建设完成。 试点、复用、治理、持续改进四级,按稳定达到的共同状态判断。
场景 入口已对师生开放,即视为覆盖。 须有高频、可评价、有责任部门的业务闭环,失败能回退。
数据与知识 一次性导入文档或开通检索即可。 来源、授权、更新、引用和失效可管理,并能点回原文。
模型与工具 绑定单一品牌或“最新大模型”。 能按任务选模型,记录版本、调用范围和成本口径。
治理 方案里写了安全承诺,演示账号可走通。 身份、权限、日志、应急和人工复核进入日常,越权可复测。
评测与运营 上线动员、参观和汇报材料代替复盘。 有评测集、知识更新、培训和复盘,改进项有责任人与时间。
验收后果 到货或演示通过即结项,下一阶段目标含糊。 每项判断对应证据;演示环境不算正式运行;下一阶段目标可验证。

选择右列,并不否定模型采购的必要性。学校仍要决定私有化、混合或受控云调用,仍要测算并发和隔离,仍要建设校级人工智能平台业务智能体。区别在于:这些建设是证据来源,不是成熟度本身。没有证据就升高一级,属于虚构阶段,不属于评估。

评估维度:场景、数据、模型、治理、评测、运营

智库卡片给出的评估维度,应作为取证提纲,而不是打分题库。下面按六项展开“看什么、要什么证据、怎样才算进入下一级”。维度可以分项记录强弱,但全校阶段仍以最低共同状态为准,避免用平均值掩盖短板。

1. 场景:是否有高频、可评价、有责任部门的业务闭环

先问三个问题:这个业务是否足够高频,值得持续维护知识;对错能否用制度原文、系统数据和人工标准判定;处室是否愿意承担知识审核和例外处理。招生咨询、办事问答、教务查询通常比“全校自由提问”更容易形成闭环。成绩异动、资助核定、未发表成果辅助则应后置,或拆成只读查询与人工确认两段。

合格证据包括:场景说明书、用户角色、禁止事项、责任矩阵、失败回退路径,以及至少一批带标准答案的测试问题。不合格替代物包括:访问量口号、无主责的校园问答入口、只能由厂商操作的后台。

2. 数据与知识:来源、授权、更新和引用是否可管理

数据评估看主数据仍以哪套系统为准,智能体只读哪些字段,写操作是否回到原流程。知识评估看每一类文件能否说出发布部门、生效日期、授权范围和下一次核对时间。引用应能回到段落或条目,不能只生成无来源段落。过期、冲突和未授权材料应能下线,而不是继续留在共享库。

合格证据包括:数据目录、字段授权、知识空间清单、更新记录和引用抽查结果。把“数据不出校园”写成一句总原则,却说不清哪一类数据经过哪一层网关,不能通过本维。

3. 模型与工具:能否按任务选模型并记录版本与成本

通识问答、检索增强、工具调用和开发实训对上下文、时延和密级要求不同,不应共用一个无法说明版本的“默认大模型”。评估时要能列出:各场景使用的模型或接口名称、是否允许出域、工具清单、写操作确认点,以及调用量或费用的统计口径。成本不必在本文给出数字,但学校应能说明统计单位和查看位置。

合格证据包括:模型清单、版本记录、工具授权表、调用日志字段和替换回退说明。合同只绑定不可替换模型、生产环境只写“最新模型”,属于本维未完成。

4. 治理:身份、权限、日志、应急和人工复核是否到位

治理不是单独的安全附录,而是贯穿场景和工具的强制条件。统一身份应落到真实师生账号;角色应区分教师、学生、管理员和访客;知识和工具应带密级与范围;越权请求应失败并留痕;关键动作应有人工复核。应急至少覆盖接口中断、知识误发布、模型拒答失效和账号泄漏后的停用。

合格证据包括:权限矩阵、越权测试记录、日志检索演示、应急演练纪要和人工确认清单。只有制度汇编、没有用低权限账号复测,不能记为治理到位。

5. 评测:是否能对同一批问题复测并比较版本

评测集应覆盖正确引用、拒答、越权、空值和接口失败,而不是只收录音演示问题。题目由业务部门出,对错标准先于模型存在。模型更换、知识更新或提示词调整后,应能重跑并记录差异。评测可以是小样本,但必须可重复;不能用评审会现场发挥代替。

合格证据包括:评测题版本、抽检记录、缺陷单和复测时间。没有固定题目就宣布准确率,属于虚构结果,评估时应直接排除。

6. 运营:是否有知识更新、培训和复盘机制

运营回答学校能否把评估变成下一学期的工作,而不是一份存档报告。知识要有更新窗口和失效检查;使用方要有分角色培训,而不是只培训管理员;复盘要能改提示词、改权限或缩小场景,而不是只总结“师生反响良好”。短板必须落到责任人和时间,下一阶段目标必须可验证。

合格证据包括:更新日历、培训对象名单与材料、复盘纪要、改进任务表。只有宣传稿和参观安排,不能通过本维。

评估步骤:输入、角色、动作与输出

下列步骤按时间顺序排列。每一步都写出输入、责任角色、动作和输出,便于写入评估计划和验收清单。角色名称可按学校处室调整,但不能出现“只有厂商评分、没有校内主责”,也不能在缺证据时填写阶段结论。

1. 冻结评估范围与对照标准

输入校级建设目标、已上线或在建场景清单、现有制度与平台边界、智库卡片中的维度和四级定义。
角色信息化牵头组织,业务部门确认哪些场景纳入本次评估,安全与保密会签数据范围,管理部门确认评估不作认证。

动作:写清本次评估覆盖哪些业务、不覆盖哪些院系自发工具;明确四级只用于阶段判断,不产出对外排名。输出:评估范围说明书、责任矩阵和“暂不评估清单”。

2. 按六维收集证据

输入场景说明书、数据与知识目录、模型与工具清单、账号权限、日志样例、评测材料、培训和复盘记录。
角色业务部门提供闭环和知识更新证据,信息化提供身份、接口、模型和日志证据,安全抽查越权和出域,厂商只配合导出不得代写结论。

动作:每条证据标注来源系统或制度文号、取证时间和是否正式运行;演示账号、临时数据和评审当天脚本单独存放,不得混入正式证据。输出:六维证据清单和“证据不足项”。

3. 对照四级作出阶段判断

输入证据清单、四级定义、各场景责任人的书面确认。
角色评估小组对照最低共同状态讨论,业务处室对场景闭环有一票说明权,信息化对平台能力有一票说明权,会议记录人固定表述。

动作:先判断每个纳入场景更接近哪一级,再判断全校共同状态;对证据不足的维度只写“无法判定”,不补写分数。输出:分场景阶段表、全校阶段判断和异议记录。禁止在此步虚构总分、平均分或认证结论。

4. 排列短板并给出改进优先级

输入无法判定项、越权或知识失效等已证实缺口、下一学期业务高峰。
角色业务提出不可接受风险,信息化提出平台依赖,安全提出必须先补的控制点,分管校领导确认优先级口径。

动作:把短板分成“阻断下一级的缺口”和“可并行补强的缺口”;每条写清不补的业务后果,不写无法验证的效果承诺。输出:短板改进优先级表,含责任人、时间窗口和验证方式。

5. 冻结下一阶段试点范围与验收条件

输入阶段判断、优先级表、平台与智能体建设节奏、人员值班能力。
角色业务确认下一场景是否愿意主责,信息化确认共性能力能否支撑,采购与财务只在范围冻结后介入,避免先买后评。

动作:只规划下一级所需的制度、数据、平台和人员能力,不一次宣布跨两级。输出:下一阶段试点范围、组织与制度建议、可验证目标和下次取证时间。

如果某一步缺少输出物,不要进入对外汇报或扩大采购。尤其是没有证据清单就填写阶段、没有责任人就宣布持续改进,都会把评估变成无法复核的材料。

核心交付物与验收重点

可取证每项阶段判断都能对应到系统、制度或运行记录,而不是口头说明。
可区分正式运行与演示环境分开存放,后者不得写入阶段结论。
可验证改进项有责任人和时间,下一阶段目标能在约定条件下复查。

核心交付物

  • 成熟度评分表和证据清单:若学校需要表格,表内只列维度、证据、是否满足和阶段判断;分数栏可空缺,不得填入无证据数字。
  • 短板改进优先级:按阻断下一级与可并行补强分类,写清不补的后果和验证方式。
  • 下一阶段试点范围:包含场景、责任部门、数据边界和暂缓清单。
  • 组织与制度建议:明确信息化、业务、安全和保密的分工,以及知识更新、账号回收和复盘节奏。

验收应覆盖的条目

  • 每项评分或阶段判断能对应到系统截图、配置说明、制度文本或日志检索记录。
  • 不把演示环境、临时账号、厂商脚本或评审当天抽样当成正式运行。
  • 改进项写有责任人、完成时间和复查方法;无主责项不得进入“已安排”。
  • 下一阶段目标可验证,能改写成“用哪批题、哪类账号、哪份目录复查”。
  • 分场景判断与全校判断同时保留,避免用单一亮点覆盖短板。
  • 评估材料标明取证日期和版本,下次复核能对比增减,而不是重写一份全新汇报。

验收必须由校内主责人签字确认证据范围。厂商可以协助导出配置和日志,但不能代为判定进入哪一级。未通过项应列出缺口、责任方和复测时间;材料齐全不能覆盖证据缺失。

采购与建设参数应写成可测试语句

若评估结论要进入下一轮建设,技术要求建议按“对象—条件—期望—证据”书写。例如:在纳入评估的办事场景中,学生账号无法检索教师工作区知识,且越权请求可在日志中按人检索;知识条目能显示来源部门和更新日期;模型调用能查出名称与版本;写操作没有人工确认不能生效。不要把“成熟度达到某级”“智能化显著提升”写成合同条款。

评估本身也不应绑定唯一产品。学校可以用校级治理平台汇集身份、知识空间和审计,用智能体承载试点闭环,用方法模型沟通阶段,但成熟度结论必须回到校内证据。相关建设方法见高校人工智能平台建设指南高校智能体建设指南,方法对照见成熟度与岗位能力模型

相关建设页

成熟度评估是校级治理的判断工具,需要与平台、智能体和方法模型一起阅读,避免单独做一份无法落地的评分表。

常见问题

买了大模型是不是就进入治理阶段?

不是。采购模型只说明学校具备调用能力,不证明场景闭环、数据授权、权限日志和评测运营已经可复用。进入治理阶段,至少要能出示统一身份、最小权限、审计日志、应急和人工复核的制度与系统证据。

成熟度评估必须打出一个总分吗?

不必。评估的目的是判断所处阶段和短板,而不是制造无法核验的分数或排名。若学校自制评分表,每一项都必须对应系统截图、制度文本或运行记录;禁止虚构总分、平均分或“已达某级认证”。

一个试点做成了能不能宣布全校复用?

不能。试点证明的是一个责任部门能跑通闭环。进入复用,要能把知识组织、提示词、评测集、权限模板和运维动作迁移到下一个业务,而不是只复制聊天入口。缺少移交清单和责任人,扩大范围只会放大不确定。

演示环境和正式运行怎么区分?

正式运行必须使用约定账号、真实授权数据和可检索日志,并能在学期中持续更新知识。厂商演示脚本、临时账号、抽样样例库或只在评审会能打开的页面,不能当作成熟度证据。

评估应由哪个部门牵头?

信息化适合牵头平台、身份、日志和模型调用取证;场景是否闭环、知识是否可更新,必须由教务、学工、招就、科研等业务部门判定。安全与保密部门审核分级和对外接口。避免信息化包办打分,也避免院系只报采购合同。

智库四级和五层方法模型是什么关系?

本文的试点、复用、治理、持续改进四级,用来判断学校当前处在哪一类建设状态。方法页中的五层模型用来描述智能能力进入业务的深度。两者都是规划工具,不是认证标准,也不能互相换算成分数。

没有评测集能不能算进入持续改进?

不能。持续改进要求能对同一批问题复测,比较知识更新、模型替换或提示词调整前后的差异,并留下培训和复盘记录。只有运维值班或模型升级公告,说明还在治理或复用阶段补作业。

成熟度评估多久做一次?

建议按学期或重大项目节点复核,而不是一年只做一次汇报材料。每次复核应更新证据清单、短板责任人和下一阶段可验证目标。没有新证据就不要改阶段判断。

信息来源与更新原则

建设与评估时应优先对照现行法律法规、网络安全与数据安全要求、教育系统数据分类分级和生成式人工智能管理规定,以及学校章程、保密、采购和信息化管理制度。政策文本以发布机关最新原文为准。本文只提供评估方法,不替代合规结论,也不提供任何学校的评分、排名或认证结果。

查看高校AI政策与数据中心 → 查看安全与合规边界 → 查看方法模型 →

本文为通用评估方法,没有使用客户名称、项目人数、效果数字或虚构评分结果。具体网络安全、数据合规、等保测评和采购要求,应由学校主管部门结合最新法律政策及校内制度确认。成熟度四级用于阶段判断,不能写成对外认证。