评测报告 · 卡安 1.0 · 教学智能体

面向化工本科教学的
智能体实测结果。

相对通用大模型基线的实际表现评估。评测集为 7 门核心课程的 919 道真实教学题,每题满分 150 分,评委盲态打分。

  • 7 门核心课程
  • 919 道真实题目
  • 每题满分 150 分
  • 基线 gpt-5
题级胜率100%

919 道题目中,卡安在每一道题上的总分都高于通用大模型基线。题目覆盖概念、推导、建模与工程设计的全部题型。

01三个维度

懂知识,也会教学。

教学引导 +36.0 pp、教学深度 +23.4 pp。卡安真正拉开差距的是教学能力:引导学生思考、预判误区、检查理解,这正是习惯直接给答案的通用大模型最缺的一环。

知识正确率

85.4%

基线 80.0% · +5.4 pp

教学引导能力

86.4%

基线 50.4% · +36.0 pp

教学深度

82.7%

基线 59.3% · +23.4 pp

02分课程表现

每门课都占优,无一负向

满分 150 分。七门课程领先 +26.7 至 +35.2 分,基线水平越高的课程,卡安的增量反而越大。

七门课程的平均得分(满分 150):基线与卡安
课程基线与卡安提升
化工原理 A2基线 99.6,卡安 134.899.6 → 134.8+35.2
化工热力学基线 97.3,卡安 130.597.3 → 130.5+33.2
反应工程基础基线 98.5,卡安 131.398.5 → 131.3+32.8
传递过程原理基线 103.5,卡安 133.2103.5 → 133.2+29.7
化工原理 A1基线 103.2,卡安 132.4103.2 → 132.4+29.2
物理化学基线 102.4,卡安 131.1102.4 → 131.1+28.7
化工系统工程基线 104.8,卡安 131.5104.8 → 131.5+26.7

03跨基座模型的稳健性

教学表现随基座模型共同进化

卡安支持匹配不同基座模型,并随模型能力增强而进化。三个维度上的增益都来自智能体架构本身,即工具与教学中间件,而不依赖某一个特定模型。

A

知识正确率

  • Gemini 3.5 Flash+2.1 pp

    92.7% → 94.8%
  • DeepSeek V4 Flash+3.0 pp

    92.8% → 95.8%
  • GLM-5+3.1 pp

    90.6% → 93.7%
B

教学引导能力

  • Gemini 3.5 Flash+29.0 pp

    62.0% → 91.0%
  • DeepSeek V4 Flash+30.1 pp

    60.7% → 90.8%
  • GLM-5+13.2 pp

    66.8% → 80.0%
C

教学深度

  • Gemini 3.5 Flash+16.3 pp

    70.3% → 86.6%
  • DeepSeek V4 Flash+28.3 pp

    64.5% → 92.8%
  • GLM-5+16.9 pp

    69.7% → 86.6%

04评测方法

口径与基线

  1. 01

    题集

    7 门主干课程 919 道真实教材习题:概念判断 178 道、推导分析 538 道、工程建模 203 道。

  2. 02

    评分

    每题 150 分=三大类(答题严谨性 / 教学引导 / 教学深度)× 5 个子项 × 10 分;评委盲态打分。

  3. 03

    基线

    基线为通用大模型 gpt-5;卡安为 gpt-5 + LangGraph Agent + 化工 MCP 工具 + 教学中间件,输入与评委完全相同。

报告版本 2026-04-24 v7

返回卡安 1.0