留学生汉语偏误的录入、标注、统计与导出。数据只存在本机浏览器,导出后才算落进你自己的文件。
填一次,之后每条语料自动带上。换学生或换课次时改这里。
国籍和母语可能不一样(比如母语英语、国籍加拿大),分开填更准确; 年龄和学习动机是选填,做研究时用得上,平时不填也不影响。
录一段学生说的话,或者选一个已有音频。音频的本体存在这台电脑的浏览器里(IndexedDB), 不会自动上传;要上传到你的云端,必须点「☁︎ 上传到云端」并确认一次。不上传也完全能用。
用法:播放到学生出错的地方 → 先在上面把「原句 / 正确形式 / 偏误性质」填好 → 点「⏱ 在当前位置打点」。这一处的偏误就挂在这个时间上,之后点时间点就能跳回去重听。
先粘学生原句,再写正确形式。两栏都填完,下面会标出差在哪儿,并给一个类型建议——建议只是建议,点一下就能改。
刚存的几条:还没有。
筛选只影响这一页看到的内容,不删任何数据;统计页有自己独立的开关。
| # | 原句 → 正确形式 | 标注 | 学生 / 母语 | 日期 |
|---|
表格右侧还有「日期」和「改 / 删」,左右滑动表格可以看到。
还没有语料。到「录入」页存第一条。
一条语料可以同时带多个性质标签,所以下面各行相加可能多于语料总条数。分母写在每行右边。
按出现条数排,只列前 15 个。没打语法点标签的语料不进这张表。
格子里是语料条数。母语只有一位学生时,这张表反映的是个人特点而不是语言背景,别急着往母语上归因。
JSON 是能原样导回来的那一份,另外三种是给人看和给论文用的。
选之前导出的 JSON。按条目 id 合并:已有的跳过,没有的补进来,不会覆盖你现在的语料。
导出文件里的列名和含义,方便你在 Excel 或 SPSS 里接着处理。
| 列名 | 含义 |
|---|---|
| 序号 | 导出时的行号,不是稳定标识 |
| 日期 | 该条语料的课次日期 |
| 学生 | 你自己定的代号 |
| 母语 | 学生第一语言 |
| 水平 | HSK 等级或初/中/高 |
| 来源 | 口语课堂 / 书面作业等 |
| 原句 | 学生产出的原始句子 |
| 正确形式 | 你给出的目标语形式 |
| 偏误性质 | 遗漏 / 误加 / 误代 / 错序 / 杂糅,多个用「;」隔开 |
| 偏误层面 | 语音 / 汉字 / 词汇 / 语法 / 语用 / 篇章 |
| 语法点 | 具体项目标签,多个用「;」隔开 |
| 可能成因 | 母语负迁移等,你的判断 |
| 备注 | 自由文本 |
| 录入时间 | 这条语料存进来的时刻 |
一个用来攒偏误语料的单文件网页。上完一节课,把学生说错或写错的句子录进来,标上性质和层面, 它替你累积、统计、导出。目标不是当场纠错,而是让一学期下来手里有一份能用的语料。
页面在有未导出语料时关闭会弹一次确认,但这道提醒不总能拦住你(有些浏览器会忽略它),别指望它。
偏误性质用的是国内偏误分析长期通用的四分法——遗漏、误加、误代、错序, 源头是鲁健骥先生 1984 年引入中介语理论后的一系列偏误分析研究, 后来的教材和论文大体沿用这套划分。本页另加了「杂糅」一类, 用来收那些两种说法混在一起、四分法不好归的句子。
偏误层面按语音、汉字、词汇、语法、语用、篇章分,这是教学与研究里常见的层次划分。
可能成因那几项(母语负迁移、目的语规则泛化、训练迁移等)是偏误分析常用的归因框架。 填它的时候留意:成因判断比性质判断主观得多,同一个句子换个人看结论可能就不一样, 所以这一栏适合当线索,不适合当结论直接进论文。