涿鹿方言数字博物馆:为濒危方言留下一份数字档案
方言是不可多得的语言样品、不可恢复的历史记忆、不能再生的文化基因。
缘起
涿鹿,地处河北省张家口市,八达岭以西、居庸关以外。这座县城的方言属于晋语张呼片,保留着入声这一古老的语音特征——短促的爆破音,在普通话中早已消失,却在涿鹿人的日常对话中延续至今。
2012 年和 2014 年,涿鹿县地方语言研究编委会先后编纂了两版《涿鹿方言汇编》。2012 年版侧重学术性,收录了方言归属研究、语音规则论述、涿鹿概况、行政村名录等七篇序言;2014 年版则大幅扩充词汇量,从七卷增至十卷,新增惯用俗语、分类汇编等实用板块。
这两份文档以 Word 格式散落在百度文库的某个角落。纸质资料终将泛黄,网盘链接终将失效。于是,我决定把它们做成一个可检索、可浏览的数字档案网站。

做了什么
涿鹿方言数字博物馆是一个纯前端的静态网站,部署在 GitHub Pages 上。它包含以下模块:
方言词典
收录两版汇编中的 2,111 条方言词条,支持按卷册浏览、按关键词搜索,每个词条都带有音调标注渲染。
比如 圪蹴k —— 入声标记 k 表示这个字要读得短促,像一个小小的爆破音。耗~ —— 波浪号表示尾音拉长,涿鹿话里管老鼠叫 “耗~”,那个拖长的尾音特别有画面感。
惯用俗语
792 条涿鹿方言俗语,按拼音首字母分组。三字格、四字格的固定表达,很多在普通话里找不到对应:
- 劈头盖脸的 —— 骂得痛快的样子
- 不实闲 —— 不闲着
- 仙说入胡咧的 —— 瞎说胡说的样子
学术档案
完整保留了 2012 年版的七篇序言,涵盖方言收集范围、方言归属(晋语 → 张呼片 → 东路坝下区 → 涿鹿北部盆地次方言小片)、13 条语音规则、涿鹿概况、各乡镇行政村名录、晋语分布图等学术研究资料。
今日方言
每次访问随机展示 15 条方言词条卡片,点”换一批”再来 15 条。像翻一本随机打开的方言词典。
分类汇编
普通话与涿鹿方言的对照表,按语义分类(自然、人事等),方便对照学习。

音调标注系统
涿鹿方言最大的语音特征是保留入声。为了在网页上直观展示,设计了一套标注渲染系统:
| 标记 | 含义 | 说明 |
|---|---|---|
| 1 | 一声(阴平) | 平呼,无转折 |
| 2 | 二声(阳平) | 前提呼 |
| 3 | 三声(上声) | 后提呼 |
| 4 | 四声(去声) | 降呼 |
| k | 入声 | 短促爆破音,晋语特有 |
| ~ | 长音 | 尾音拉长 |
| 儿 | 儿化音 | 儿化韵 |
实现上提供了两种显示模式:徽章模式(音调标记显示为小角标)和圆点模式(用颜色圆点表示声调),用户可以切换。
技术实现
整个项目是纯前端应用,零框架依赖:
- 技术栈:HTML5 + CSS3 + Vanilla JavaScript
- 数据格式:JSON(从 Word 文档通过 Python
python-docx提取、清洗、结构化) - 路由:基于 URL hash 的 SPA 路由(
#/dict、#/academic、#/idioms等) - 搜索:纯前端客户端搜索,支持词条名和释义模糊匹配
- 暗色模式:CSS 变量 +
localStorage+matchMedia系统偏好检测 - 响应式:媒体查询适配移动端,汉堡菜单
- 动画:CSS keyframes + IntersectionObserver 滚动揭示 + requestAnimationFrame 数字递增
- 部署:GitHub Pages,推送即部署
数据处理流程
原始 Word 文档 (.docx)
↓ python-docx 解析
结构化提取(段落、标题、词条)
↓ 正则匹配 + 规则清洗
过滤选择题、脏话词汇
↓ JSON 序列化
6 个数据文件 → 前端直接加载
最终产出的数据文件:
academic.json— 学术档案(前言 + 7 章)vocab-2012.json— 2012 版词汇(7 卷)vocab-2014.json— 2014 版词汇(10 卷)idioms.json— 惯用俗语(792 条)categories.json— 分类汇编meta.json— 元数据与统计信息
音调渲染器
音调渲染是这个项目最有趣的技术点。原始数据中,音调信息以纯文本形式标注在汉字后面:
圪蹴k → 圪蹴 + 入声标记
耗~ → 耗 + 长音标记
花1钱 → 花(一声) + 钱
tone.js 中的 ToneRenderer 模块负责分词和渲染:
- 分词:正则匹配识别汉字、音调标记(1234、k、~、儿)、拼音注音
- 渲染:根据当前显示模式,将音调标记转换为 HTML 元素(
<sup>角标或<span>圆点) - 样式:CSS 控制颜色、大小、位置,入声用红色、长音用紫色、儿化用粉色
数据不完整性声明
值得说明的是,当前数据来源于百度文库的公开版本,原始文档存在截断。这意味着部分卷册的词汇不完整,分类汇编的数据也有缺失。网站上对此做了明确标注。
如果有人持有完整版的原始资料,欢迎联系补充。

为什么要做这件事
2012 版汇编的前言里有一段话:
30 年后,地方语言或将大幅消失;二三百年后,或将不复存在。为方言留档,挽救濒危古语刻不容缓。
这段话写于十多年前。普通话的普及速度比预想的还要快。在城市家庭中,老一代说地道方言,第二代或不能说但尚可听懂,第三代就只能听讲纯粹的普通话了。
一种动物的消失会导致生物链的缺失,一种方言的消失,意味着文化链的缺失。
我们现在所能做到的,惟有尽量将其完整地记录保存下来,留给后人。这个小小的数字博物馆,就是这样一次尝试。
项目地址:GitHub
在线访问:涿鹿方言数字博物馆
民间整理,非官方出品。基于《涿鹿方言汇编》2012 年第一版 & 2014 年第三版。