
分享小组 | 资源采集组
分享人 | 陈熙元

这是2026年潮人语·资源采集组的第1次主题分享,介绍我们多年来方言语料资源采集落地实践。

本次分享分为四个部分:
第一部分寻根溯源,和大家讲清楚我们耗费人力、时间采集方言语料的核心价值与意义。
第二部分躬身入局,介绍过去落地推进的四大类资源采集实践项目。
第三部分复盘反思,结合六年多实操经验,剖析采集、管理两大环节遇到的核心痛点。
第四部分数字赋能,针对现存问题提出数字化平台建设构想,畅想未来方言资源采集标准化、可持续的工作模式。
1. 寻根溯源:语料资源采集意义

首先进入第一部分,寻根溯源,聊聊方言语料采集的三大核心意义。
第一,最基础的价值:完成本土语言完整记录,搭建完整的人类地方语言资源档案。海宁各镇街方言差异细微,很多老一辈母语使用者逐年减少,如果不及时录音留存,本土方言词汇、句式、口音会永久流失,采集本质是为地域文化留存原始语言档案。
第二,实用落地价值:为方言教育、本土文化科普、方言工具研发提供真实、地道的一手参考素材。不管是线下方言课堂、线上科普短视频,还是方言读本、学习小程序,都离不开真实录制的本土语音作为基础素材。
第三,前沿技术价值:支撑方言 AI 模型训练,让本地老年群体也能用母语享受数字化技术成果。当下通用 AI 大多以普通话为主,缺少方言语料,我们采集的语音素材,能够用来训练适配海宁吴语的语音识别、语音合成模型,降低老年人使用智能设备的语言门槛。
2. 躬身入局:四大资源采集实践

接下来进入本次分享的核心板块 —— 躬身入局:四大资源采集实践。从 2020 年至今,我们结合不同场景、不同需求,先后落地四种差异化采集模式,分别是日常对话自然采集、结合方言教育的标准化文本采集、结合科普实用创新的垂直语料采集、结合本土文学艺术创作的专题词汇采集,各有优势和无法回避的局限。
首先是第一个实践项目,2020 年 4 月启动的日常对话自然采集。 一共 13 位志愿者参与日常闲聊录制,覆盖海宁 9 个核心方言点位,录制完成后会做基础剪辑,去除环境杂音,每个点位最终留存音频数量都只有个位数。
这种无剧本、无预设的闲聊录制,最大优势就是语料自然度极高,完全还原本地人日常聊天、交际时真实的语言使用习惯,没有书面翻译带来的生硬感,是最贴近生活的原生方言素材。
但局限性也很明确:
第一,线下录音环境不可控,街道、家中、户外录制都会混入大量环境杂音或者多人重叠语音,后期剪辑成本很高;
第二,聊天话题完全随机,无法定向收集特定场景、特定领域词汇;
第三,项目高度依赖志愿者自发空闲时间和参与意愿,缺少稳定督促和激励机制,很难长期持续采集。

第二个实践,2020 年 6 到 12 月开展了与教育普及相结合的海宁话 900 句项目。先划分日常生活场景,编写 900 句标准化普通话基准文本,再由本土地道发音人逐句翻译成海宁方言,同步录制音频、配套制作教学短视频;2020年7到12 月,我们完成硖石、盐官、周王庙、许村、黄湾5 个方言点位、每个点位 80 句的录制工作。
项目成效非常突出:标准化文本能精准控制录制话题,整体录制进度可规划、可量化,适合批量产出标准化教学素材,适配线下课堂、线上短视频科普。
但同样存在明显局限:当代人习惯书面普通话思维,直译出来的方言免不了带有 “翻译腔”;素材质量完全依赖发音人自身的方言功底、口头翻译能力,个体差异极大,素材质量参差不齐。

这是第一次把海宁吴语拓展到气象垂直专业领域,填补了本土方言在科普、现代专业场景下的语料空白,丰富方言现代化应用场景,打破方言只能聊日常家长里短的固有局限。
项目短板也很突出:科普文本包含大量专业气象术语、书面长难句式,和本地人日常口语表达习惯差距很大,朗读时生硬拗口,语音流畅度差,整体利用价值有限。

第四个实践,2024年6至8月,开展了结合本土文学创作的吴语词汇盘点项目。每月设定一个主题,比如第一期主题 “防暑、乘风凉”,由项目牵头人撰写方言散文,全体组员一起补充对应主题本土特色词汇,持续了3个月。
对比前面文本翻译模式,本项目最大优势是采用方言本位创作,先有方言文学、方言词汇,而非根据普通话翻译,同时能精准锁定主题,语料自然度、话题可控性同时兼顾,产出的散文、词汇还能用于本土文化宣传,附加文化价值更高。
短板也十分明显:散文原创、本土词汇挖掘对志愿者文字功底、方言储备要求极高,参与门槛大幅提升,创作消耗大量时间精力,很难常态化、长期稳定更新,项目容易中途停滞。
3. 复盘反思:采集过程痛点剖析

结合四个项目的实操经验,总结采集环节和管理环节的痛点。
采集环节,有两大难以平衡的跷跷板矛盾:
第一,自然度与可控性难以兼得。如果做无剧本日常对话,语音地道自然,但录音杂音多、话题散乱,无法定向收集目标词汇;如果用标准普通话文本翻译录制,话题可控、素材规整,但容易出现生硬翻译腔,丢失方言原生语感,二者很难同时兼顾。
第二,参与门槛与项目持续性相互制约。像词汇盘点、散文创作这类模式,能同时解决自然度和可控性问题,但文字创作、深度方言挖掘大幅抬高志愿者参与门槛,不管是发音人还是组织者都需要投入大量时间,不易长期坚持。
后端管理层面,有两大信息孤岛危机:
第一,没有统一数字化资产存储中枢。我们六年积累的音视频方言素材,长期分散存放在个人手机、电脑、不同网络平台,没有统一仓库,随时存在文件丢失、版本混乱的风险,历史语料无法完整留存。
第二,语料元数据标注严重缺失。绝大多数录音、视频文件只有音频本身,没有配套标注:分不清对应哪个方言点位、哪位发音人、配套原文文本、口音特征、使用场景,缺少标注的语料无法检索、分类,也不能直接用于 AI 模型训练、辞典查询,采集价值大打折扣。
4. 数字赋能:未来采集工作畅想

分析痛点后,我们畅想未来语料收集的理想目标,简单概括三个标准:
第一,语音素材自然地道、话题覆盖全面;
第二,音频录制纯净、杂音少,后期处理成本低;
第三,整套采集流程稳定可持续,不用过度依赖少数核心志愿者。

为实现理想采集状态,结合当前AI编程技术的发展,我们或许可以尝试搭建一套数字化方言资源工作平台,分为三大核心功能模块:
第一,多媒体资产统一管理模块。搭建专属数据仓库,统一存储全部方言音频、视频素材,支持线上在线预览、流媒体播放,集中归档所有历史语料,从根源解决素材散落、丢失、版本混乱的问题。
第二,多维度精细化标注系统。自主开发结构化线上打标工具,每一条语音素材都可以绑定完整元数据:所属方言点位、国际音标标注、方言/普通话对照文本、使用场景、发音人信息等,完成深度标签绑定,让语料具备检索、训练、研究的完整使用价值。
第三,无缝对接本土电子辞典生态。平台开放标准化 API 数据接口,我们采集的所有标准化语料,能够直接作为底层素材接入海宁吴语电子辞典,编纂词条时可以直接搜索播放地道语音作为参考,让采集成果直接服务工具研发。
资源采集组话题日历
2026年7月:潮人语做过什么样的资源采集尝试?有什么不足?
2026年8月:语言学界是怎么做田野调查的?有什么不足?
2026年9月:科大讯飞、阿里巴巴等互联网公司是怎么收集、标注语料的?有什么不足?
2026年10至12月:我们可以如何采集、标注海宁吴语?需要怎样的人员支持、信息系统支持?

方言辞典

小红书
云音乐

QQ音乐

Apple
B站

抖音
视频号
知乎

微博






