Install
openclaw skills install @qizhitang/xiaozhi-teach-english-assessment英语综合测评设计:帮英语老师把"一张卷子"变成听说读写四维的能力测评与画像;高中按合格性考试与高考的课标口径设计。触发语:"学员英语水平如何"、"英语综合测评怎么设计"、"听说读写怎么测"、"CSE/CEFR 对照怎么用"、"学员能做什么"、"英语能力画像"、"高一英语单元测评怎么设计"、"测完之后怎么给建议"。核心工作流:能力目标(听说读写 4 维)→ 以 CSE 描述语定级、CEFR 只作国际参照 → 测评设计 → 能力画像(分数 + 微技能)→ 教学干预建议 → 写回班级工作空间。不处理:听力材料的选编与听法训练(转英语听力材料设计)、口语活动与纠错策略(转英语口语活动设计)、通用命题的双向细目表与信效度(转 xiaozhi-teach-exam-designer)。
openclaw skills install @qizhitang/xiaozhi-teach-english-assessment一句话定位: 英语测评不是给学员"打分数",而是给教学"画能力地图"——以 CSE 为主、CEFR 为参照的能力框架是核心。
技术边界:本 SKILL 依赖能力 [M, X, F],无该能力时按 shared/platform-conventions.md 降级。 无 X 时不输出跨次的等级变化统计,只呈现本次测评数据;无 F 时请老师粘贴逐题分数表格。
教学主体边界:本 SKILL 只给老师出草稿、做分析,不替老师上课,不代老师回答学生的问题,也不代老师评价学生;面向学生或家长的内容,一律由老师审定后再用(教育部《中小学生成式人工智能使用指南(2025 年版)》)。
本 SKILL 不做的三件事:
copyrightStatus(自有 / 改编 / 公开可引用 / 仅存索引);不复制未授权材料。AI 生成的题目:按 shared/ai-item-check.md 自检后输出,且一律标注
【AI 生成,入库前请人工验算】;未经老师确认不得写入资源库或试卷
(对应 classWorkspace.examBlueprints[].items[].aiGenerated / verifiedByTeacher)。
启用前的统考试题不得输入本 SKILL——国家、省、地(市)级教育统一考试启用前的试题、参考答案、评分标准属国家秘密(《教育工作中国家秘密及其密级具体范围的规定》),区县级、校级统考按当地保密要求同样处理。 老师说明正在为统考命题时,本 SKILL 只提供命题方法、双向细目表框架与自编练习,不接收、不生成、不审改该卷的具体试题;已经考完的试题可以正常分析与讲评。 依据《中小学生成式人工智能使用指南(2025年版)》教师一节:“严禁将个人信息、考试试题等敏感数据输入AI工具”。
英语综合测评常见的三个误区:
误区① 测评=笔试:只测读写,
学员"会做卷"但"不会用"。
误区② 测评=分数:只关心分数,
没看学员"能做什么"。
误区③ 测评=一刀切:所有学员同一份卷,
没考虑学员的实际水平。
本 SKILL 要解决的是:
| 触发场景 | 示例语句 |
|---|---|
| 学员英语水平 | "学员英语水平如何" |
| 英语综合测评 | "英语综合测评" |
| 听说读写 | "听说读写怎么测" |
| 能力等级对照 | "CSE/CEFR 对照怎么用" |
| 学员能做什么 | "学员能做什么" |
| 英语水平档案 | "英语水平档案" |
| 英语能力评估 | "英语能力评估" |
| 学员英语弱 | "学员英语弱" |
┌──────────────────────────┐
│ ① 能力目标 │
│ 听说读写 4 维 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ② 等级对照 │
│ CSE 为主,CEFR 参照 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ③ 综合测评设计 │
│ 听/口/读/写 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ④ 学员能力画像 │
│ 4 维 + 微技能 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ⑤ 教学干预建议 │
│ 班级+个体 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ⑥ 写回 student-analyzer │
│ 英语能力维度 │
└──────────────────────────┘
┌──────────┬────────────────────────┬──────────────┐
│ 维度 │ 描述 │ 能力 │
├──────────┼────────────────────────┼──────────────┤
│ 听 │ 听懂英语 │ 输入-听觉 │
│ 说 │ 用英语说话 │ 输出-口语 │
│ 读 │ 读懂英语 │ 输入-视觉 │
│ 写 │ 用英语写 │ 输出-书面 │
└──────────┴────────────────────────┴──────────────┘
■ 输入 vs 输出
· 听 + 读 = 输入
· 说 + 写 = 输出
■ 输入与输出关系
· 学员需要先有输入
· 才有输出
■ 4 维协同
· 4 维不能割裂
· 综合使用
■ 基础层
· 听:听懂简单句
· 说:能用单词/短句
· 读:看懂短文
· 写:能写简单句
■ 中等层
· 听:听懂日常对话
· 说:能流利对话
· 读:看懂中长文
· 写:能写短文
■ 提升层
· 听:听懂复杂材料
· 说:能表达观点
· 读:看懂专业文章
· 写:能写各类文章
口径说明: 对 K12 应以《中国英语能力等级量表》(CSE,GF 0018—2024,九级;2018 年首次发布,修订版 2024 年 11 月 26 日发布、2025 年 3 月 1 日起实施,代替 2018 年版)为主标准,CEFR 只作国际参照。切勿把等级对标定得过高——常见误区是把"初中毕业"标成 B1、"高中毕业"标成 B2。按量表发布时的通行解读,中考约当 CSE 三级,高考约当 CSE 四级,大学英语四级约当五级,大学英语六级约当六级。CSE 与 CEFR 的对接随技能不同而有差异;以写作能力的对接研究为例,CSE 三级约当 A2,四级、五级都约当 B1,六级约当 B2,七级约当 C1。
┌──────────┬────────────────────────────┬──────────────────────┐
│ CSE │ 学段 / 考试(约当) │ CEFR 参照(写作为例) │
├──────────┼────────────────────────────┼──────────────────────┤
│ 一至二级 │ 小学(二级约当小学毕业) │ A1 │
│ 三级 │ 初中毕业 / 中考 │ A2 │
│ 四级 │ 高中毕业 / 高考 │ B1 │
│ 五级 │ 大学英语四级 │ B1 │
│ 六级 │ 大学英语六级、英语专业四级 │ B2 │
│ 七级 │ 研究生、英语专业八级 │ C1 │
│ 八至九级 │ 高端外语人才 │ C1—C2 及以上 │
└──────────┴────────────────────────────┴──────────────────────┘
(都是"约当"关系,不是等值;CEFR 一列只是写作能力对接研究的结果,别的技能、不同来源的对接结果都可能差一档;定级以 CSE 描述语原文为准)
❌ 禁止:由卷面分数或正确率直接换算等级
(如"70 分 = B2""正确率 55-69% = B1")。
理由有三:
① 分数只反映"这张卷上的这些题",题目难度不同,同一个分数含义完全不同;
② CSE/CEFR 是**能力描述**框架,判定依据是"能不能完成某类任务",不是得了多少分;
③ 直接换算最容易把 K12 学员的等级抬高,给学员和家长错误预期。
✅ 正确做法(三步):
Step 1 看逐题得分(classWorkspace.itemScores[]),确认学员在哪些
**任务类型**上稳定完成、哪些不稳定
Step 2 拿这些表现去对照 CSE 相应等级的描述语
("能听懂…""能就…作简单描述"),由老师判断落在哪一级
Step 3 等级写成区间 + 证据,如
"听:CSE 3(约当 A2)——两次测评都能听懂日常对话中的时间与地点,
但短文推断题两次都错"
单次测评、样本不足时标 🔴(shared/vocab.md §7),只作参考不入档案
分数的用途:定位强弱维度、看进退步、决定下一步教什么——不是用来贴等级的。
📎 CSE 各级描述语以教育部发布的量表原文(现行 2024 年修订版)为准;
references/cefr-four-skill-descriptors.md提供 CEFR 侧的四维简表,仅作国际参照。
⚠️ 旧版有两张对照表,都已订正并合成 §5.1 一张:
- 中考 / 初中毕业 ≈ CSE 三级(约当 A2),不是 B1,也不是"CSE 3-4";
- 高考 / 高中毕业 ≈ CSE 四级(约当 B1),不是 B2;旧版写的"高考约 CSE 5"偏高一级——CSE 五级约当大学英语四级;
- 大学英语四级 ≈ CSE 五级(约当 B1),不是 B2;
- 英语专业八级 ≈ CSE 七级(约当 C1),不是 CSE 8。 对 K12 学员定级时优先用 CSE 描述语,避免因 CEFR 定标过高而对学员/家长造成不合理预期。
┌──────────┬────────────────────────┬──────────────┐
│ 类型 │ 描述 │ 时机 │
├──────────┼────────────────────────┼──────────────┤
│ 诊断性 │ 查起点 │ 学期初、单元开始 │
│ 形成性 │ 给反馈、看进步 │ 单元教学过程中 │
│ 终结性 │ 评掌握 │ 单元末、期中、期末 │
└──────────┴────────────────────────┴──────────────┘
(与 xiaozhi-teach-exam-designer §四 同一口径)
■ 听力(题型按中考听力结构排,不用托福/雅思式分类)
· 时长:20-25 分钟(含播音)
· 题型:听句选图(或短对话选答语)→ 对话理解 → 短文理解 → 听填信息
· 语速:约 100-120 词/分钟(中考听力常见区间)
· 详细题型设计见「英语听力材料设计」SKILL
■ 口语(校内班级测评的现实约束见下)
· 时长:单人 3-5 分钟(不是 10-15 分钟)
· 题型:朗读 → 情景问答 → 看图/话题连续表达
· 组织:分批或分组进行,见下方"班额可行性"
■ 阅读
· 时长:30-40 分钟
· 题型:细节 → 主旨 → 推断 → 词义猜测(按中考阅读的题型比重)
· 难度:略高于日常教学材料
■ 写作
· 时长:20-25 分钟
· 题型:以应用文(书信/邮件/通知)与记叙文为主;
议论文只在初三下学期按本地中考题型需要时才考
· 字数:初中 80-100 词
口语测评的班额可行性(先算,再排)
所需课时 ≈ 班额 × 单人时长 ÷ 并行考场数 ÷ 45 分钟
例:50 人班,单人 4 分钟,1 位老师逐个考
→ 50 × 4 = 200 分钟 ≈ 4.5 节课,不现实
可行的三种排法(老师选一种,本 SKILL 不替老师决定):
① 双人同考:两名学员一组做对话任务,单组 5 分钟
→ 25 组 × 5 = 125 分钟 ≈ 3 节课,仍偏多,适合期末统测
② 抽样 + 全员录音:课上抽 8-10 人现场考(作为定标样本),
其余学员课后录音提交,老师按同一份 rubric 评
→ 课上约 40 分钟,1 节课内完成
③ 分组轮转:全班分 4-5 组,一组做口语任务、其余组做笔试部分,轮换
→ 1-2 节课内完成,需另一位老师或助教协助计时
⚠️ 若排不出时间:宁可缩短单人时长或降低频次,
也不要把 25 分的口语分改成"平时印象分"——那不是测评。
⚠️ 本 SKILL 是通用
xiaozhi-teach-exam-designer的英语学科细化,不是替代。 双向细目表的测量学基础——难度系数 P、区分度 D、四类测评目的、考后实际 P/实际 D 分析——沿用通用版定义;本 SKILL 只补充听说读写四维的能力描述与 CSE/CEFR 对照,不重定义、不删减测量学工具。
■ 听力双向细目表
· 主旨 + 细节 + 推断 + 观点
■ 口语双向细目表
· 流利 + 准确 + 得体
■ 阅读双向细目表
· 字面理解 + 推断理解 + 评价理解
■ 写作双向细目表
· 内容 + 结构 + 语言 + 规范
📎 完整样板见
references/comprehensive-assessment-sample.md(听/说/读/写 4 维加权的综合测评结构示例)
┌──────────┬────────────────────────┐
│ 维度 │ 描述 │
├──────────┼────────────────────────┤
│ 听 │ 听力能力 │
│ 说 │ 口语能力 │
│ 读 │ 阅读能力 │
│ 写 │ 写作能力 │
│ 词汇 │ 词汇量 │
│ 语法 │ 语法能力 │
│ 等级判定 │ 由老师对照 CSE 描述语给出(不由分数换算) │
│ 强项 │ 强维度 │
│ 弱项 │ 弱维度 │
└──────────┴────────────────────────┘
📎 完整模板见
references/student-ability-profile-template.md(4 维等级 + 微技能 + 词汇/语法 + 强弱项的填写模板)
听
│ ┌───
│ / 5
│ /
│/_____
说 读
│ ╲
│ ╲
│ ╲
写
┌──────────┬────────────────────────┐
│ 弱维度 │ 干预 │
├──────────┼────────────────────────┤
│ 听 │ 听力材料+微技能训练 │
│ 说 │ 任务型活动+情境练习 │
│ 读 │ 阅读策略+分级阅读 │
│ 写 │ 写作模板+过程引导 │
└──────────┴────────────────────────┘
分档依据:2022 版义教英语课标三级词汇表约 1600 词(中考范围);
高中课标附录 2 共 3100 词(含义教 1600 词;必修累计约 2100、选择性必修累计约 3100)⚠高中。
· 课标 1600 词内、掌握不足 → 先把这部分补齐(中考绝大多数考点在此范围)
做法:按话题成组补(校园/健康/环保/文化/成长),不按字母表背
· 课标 1600 词已基本掌握 → 补中考语篇里的高频超纲词(只求读到时认得出)
做法:从近年本地中考真题语篇里取词,不另找词表
· 已超出中考需求、学员主动要求 → 高中课标词表 ⚠高中
做法:说明这是高中内容,按学员意愿安排,不计入本学段的达标判断
❌ 不用 AWL 分级 ⚠高中(大学学术写作场景才用得着;高中学员同样不用):AWL 取自英语学术论文语料,
与义教课标、中考语篇的词频分布不一致,对初中生会把方向带偏。
❌ 不用"主动词汇 N 词"这类估计值做分档依据——课堂上没有可靠的测量手段。
📎 完整样板见
references/intervention-suggestion-sample.md(短/中/长期干预建议 + 资源推荐 + 复测评估示例)
■ 每次测评
· 更新 4 维档案
· 标记进步/退步
■ 每月复盘
· 4 维能力变化
· 强项弱项变化
· 调整教学
📎 完整样板见
references/english-growth-archive-sample.md(时间轴 + 4 维进步 + 持续弱项 + 教学调整示例)
┌────────────────────────┐
│ xiaozhi-teach- │
│ student-analyzer │
│ (学员 4 维能力数据) │
└───────────┬────────────┘
│
↓
┌────────────────────────┐
│ xiaozhi-teach- │
│ english-assessment │
│ (本 SKILL) │
└───────────┬────────────┘
│
┌─────────────────┼─────────────────┐
↓ ↓ ↓
student-analyzer lesson-planner resource-library
(4 维能力画像) (教学干预计划) (4 维素材)
shared/class-teaching-workspace.schema.json)读:
classWorkspace.classProfile → 学段、班额、课时、常用满分
classWorkspace.itemScores[] → 逐题得分(能力画像的唯一来源;
只有总分时不得生成逐维度画像)
classWorkspace.itemStats[] → 各题难度 P / 区分度 D
classWorkspace.classSummaries[] → 班级均分、得分率、分布
classWorkspace.weaknessRank[] → 班级顽固弱项排序
classWorkspace.reviewPlans[] → 同一场考试是否已有复习计划(有就在原计划上补充)
写(均为待老师确认的条目,确认后落库):
classWorkspace.examBlueprints[] → 四维测评蓝图(含 itemType: 听力/口语/阅读/写作)
AI 生成题 aiGenerated=true,
老师验算后才可 verifiedByTeacher=true
classWorkspace.weaknessRank[] → 由四维得分归纳出的弱项条目
classWorkspace.reviewPlans[] → 干预建议转成的复习排布,只写英语条目;
同一场考试已有复习计划时在原计划上补充,不另起一份;
写入守复习规划师的三道门:老师确认、只用化名、不写个体分数与名次
写回学生档案(可选,需授权):
handoverType = "teacher_writeback",recipient = xiaozhi-learning-dna
前置:交接体中的授权快照 teacherWritebackConsent 必须为 true,否则丢弃并告知老师
内容:weakKnowledgePointUpdates 列表(subject / knowledgePoint /
status / masteryLevel),note 只写低敏事实描述
掌握度转换(shared/vocab.md §6):老师端五档 → 学生端三档,写回时必须转换
已掌握 → 真正掌握 / 基本理解 → 会解释 / 仍需巩固 → 会复述
需要重讲 → 会复述(并在 note 里注明"复述也不完整")
证据不足 → 不写入这一条
❌ 不写 CSE/CEFR 等级、不写学员真实姓名、不写心理标签
写回学生档案的交接示例(与 handover-protocol.schema.json v2.1 一致):
{
"sessionId": "sess-teach-eng-assess-001",
"protocolVersion": "2.10.0",
"handoverType": "teacher_writeback",
"sender": "xiaozhi-teach-english-assessment",
"recipient": "xiaozhi-learning-dna",
"consent": { "crossSkillSharing": true, "teacherWritebackConsent": true },
"payload": {
"teacherWritebackData": {
"teacherSkill": "xiaozhi-teach-english-assessment",
"studentAlias": "E-007",
"weakKnowledgePointUpdates": [
{ "subject": "英语", "knowledgePoint": "听力·听填信息", "status": "初步弱项", "masteryLevel": "会复述" }
],
"note": "两次测评中听填信息题得分率明显低于同卷其他听力题型"
}
},
"timestamp": "2026-09-03T18:00:00+08:00"
}
✅ 能力画像用化名
✅ 班级报告用编号
❌ 禁止:公开"某学员的英语等级"
❌ 禁止:未授权公开测评材料
✅ 测评结果可入档案(脱敏后)
| ✅ 应该做 | ❌ 不能做 |
|---|---|
| 4 维综合(听说读写) | 测评=笔试 |
| 对照 CSE 描述语判等级 | 分数直接换算等级 |
| 能力画像 | 测评=一刀切 |
| 4 维差异 | 单一分数 |
| 教学干预 | 测完就完事 |
| 学员化名 | 公开学员等级 |
英语综合测评
<── xiaozhi-teach-student-analyzer(4 维能力)
<── xiaozhi-teach-lesson-planner(教学计划)
──→ xiaozhi-teach-student-analyzer(4 维画像)
──→ xiaozhi-teach-lesson-planner(教学干预)
──→ xiaozhi-teach-resource-library(4 维素材)
──→ 学生端 5 个英语 SKILL(语法/听力/口语/词汇/写作,学员视角)
禁止行为:
teacherWritebackConsent 写回学生档案依据《普通高中英语课程标准日常修订版(2017 年版 2025 年修订)》"学业水平考试与高考建议"。老师说明带的是高中班,或学员在读高中时用本节;初中仍按第四至九节。
| 项 | 合格性考试 | 高考 |
|---|---|---|
| 内容范围 | 必修 | 必修与选择性必修 |
| 水平要求 | 可参照学业质量水平一 | 可参照学业质量水平一和水平二 |
| 形式 | 一般采用笔试,包括听力考试;有条件的地区可以实施口试 | 一般采用笔试(闭卷,包括听力考试);条件允许时可以组织口试(口语考试或听说考试) |
| 考查侧重 | 覆盖听、说、读、看、写,可注重听力、阅读等理解性技能 | 更加全面深入地考查理解性技能,同时注重表达性技能 |
examBlueprints[].items[] 的 itemType、score、expectedP;情境类别、学业质量水平与各部分的作答时间只写在给老师的细目表里。高一单元测评的蓝图示例(学校自编,只示范怎么写课标要求的几个维度,不代表任何一省的试卷结构;分值与时间由 CI 验算)见 references/hs-assessment-blueprint.md。
references/cefr-can-do-statements.md — "能做什么"语句(CSE 为主、CEFR 参照;含定级判定流程)references/four-skill-rubric.md — 4 维(听说读写)评分细则(只出分数 + 微技能,不出等级)references/assessment-template.md — 综合测评设计模板(4 阶段)references/cefr-four-skill-descriptors.md — CEFR 4 维对照速查表(A1-C2 听说读写描述)references/comprehensive-assessment-sample.md — 4 维测评样板(综合测评结构示例)references/student-ability-profile-template.md — 学员能力画像填写模板references/intervention-suggestion-sample.md — 教学干预建议样板references/english-growth-archive-sample.md — 学员英语成长档案样板references/hs-assessment-blueprint.md — 高一单元测评的蓝图示例:课标命题规划的几个维度、各部分分值与作答时间、整卷预期 P 的算法(含 CI 验算断言)💡 小智说: "英语测评不是给学员'打分数', 是给教学'画能力地图'。 学员不是'90 分'或'80 分', 而是'能听懂日常对话、能读短篇故事、 能介绍自己、能写简单邮件'—— 能力量表的意义就在这里:先看他能做什么,再决定教什么。"