知识正确率
85.4%
基线 80.0% · +5.4 pp
评测报告 · 卡安 1.0 · 教学智能体
相对通用大模型基线的实际表现评估。评测集为 7 门核心课程的 919 道真实教学题,每题满分 150 分,评委盲态打分。
919 道题目中,卡安在每一道题上的总分都高于通用大模型基线。题目覆盖概念、推导、建模与工程设计的全部题型。
01三个维度
教学引导 +36.0 pp、教学深度 +23.4 pp。卡安真正拉开差距的是教学能力:引导学生思考、预判误区、检查理解,这正是习惯直接给答案的通用大模型最缺的一环。
85.4%
基线 80.0% · +5.4 pp
86.4%
基线 50.4% · +36.0 pp
82.7%
基线 59.3% · +23.4 pp
02分课程表现
满分 150 分。七门课程领先 +26.7 至 +35.2 分,基线水平越高的课程,卡安的增量反而越大。
| 课程 | 基线与卡安 | 提升 |
|---|---|---|
| 化工原理 A2 | 基线 99.6,卡安 134.8 | 99.6 → 134.8+35.2 |
| 化工热力学 | 基线 97.3,卡安 130.5 | 97.3 → 130.5+33.2 |
| 反应工程基础 | 基线 98.5,卡安 131.3 | 98.5 → 131.3+32.8 |
| 传递过程原理 | 基线 103.5,卡安 133.2 | 103.5 → 133.2+29.7 |
| 化工原理 A1 | 基线 103.2,卡安 132.4 | 103.2 → 132.4+29.2 |
| 物理化学 | 基线 102.4,卡安 131.1 | 102.4 → 131.1+28.7 |
| 化工系统工程 | 基线 104.8,卡安 131.5 | 104.8 → 131.5+26.7 |
03跨基座模型的稳健性
卡安支持匹配不同基座模型,并随模型能力增强而进化。三个维度上的增益都来自智能体架构本身,即工具与教学中间件,而不依赖某一个特定模型。
Gemini 3.5 Flash+2.1 pp
92.7% → 94.8%DeepSeek V4 Flash+3.0 pp
92.8% → 95.8%GLM-5+3.1 pp
90.6% → 93.7%Gemini 3.5 Flash+29.0 pp
62.0% → 91.0%DeepSeek V4 Flash+30.1 pp
60.7% → 90.8%GLM-5+13.2 pp
66.8% → 80.0%Gemini 3.5 Flash+16.3 pp
70.3% → 86.6%DeepSeek V4 Flash+28.3 pp
64.5% → 92.8%GLM-5+16.9 pp
69.7% → 86.6%04评测方法
7 门主干课程 919 道真实教材习题:概念判断 178 道、推导分析 538 道、工程建模 203 道。
每题 150 分=三大类(答题严谨性 / 教学引导 / 教学深度)× 5 个子项 × 10 分;评委盲态打分。
基线为通用大模型 gpt-5;卡安为 gpt-5 + LangGraph Agent + 化工 MCP 工具 + 教学中间件,输入与评委完全相同。
报告版本 2026-04-24 v7
返回卡安 1.0