这是什么#
一个探索性方案:把多部词典里的义项整理成一份总表,并为每个字段注明来源。以 Open English WordNet 2025 作为骨架。不发布任何词典原文。(原文:A spike: one sense inventory assembled from many dictionaries, with provenance on every field. Open English WordNet 2025 as the spine. No dictionary text is published.)
- 代码仓库:https://github.com/xiaolai/xiaolaidict-customized-wordnet
- 主要用 Python 写成
最近的改动#
其他改动
- 把 README 定位为探索性方案,并说明目前的缺口
- 导入这部双语词典,不再把短语动词归到错误的单词下面
- 两个来源记录了同一个词形变化,不代表它们是重复内容
- 给搭配关系的另一端也补上对应的词
- 导入 Oxford 自己的词形变化索引,规模是现有表格的 22 倍
- 把 Oxford 的同义词放到 Oxford 对应的义项下面
- 不再认为义项顺序可以用来对应不同来源的内容
- 补上另一个维度:620,934 条带等级的同义词和反义词关系
- 保留搭配所属的义项,也补上这本书中我一直跳过的后半部分
- 读取 Oxford 的搭配信息,并衡量展示这些内容的代价
- 驳回“Oxford 缺少 60% 多词条目”的说法
- 完整读取这部词典,而不是只读最后四分之一
- 记录 Oxford 最终包含了什么,以及使用它付出了什么代价
- 别再猜一个短语是什么,直接测量识别它要付出什么代价
- 读取 Oxford 自己的短语列表,不再每次只查询一个单词
- 在句子里寻找这个短语,而不是只找光标指向的那个单词
- 只做一次标准化并配上测试,不要错误地重复做三次
- 分组本身包含信息,并不只是让选项变少
- 按义项实际被使用的频率排序,并说明这意味着什么
- 确定读者实际指向的是哪个词形
- 记录所有内容分别来自哪里
- 遵循现有的分组方式,结果就会更小
- 由于这个资源很难通过认证,因此要衡量产品本身
- 评估一个方案,而不是直接把它做出来
- 重写那个被验证过程证明有问题的工具
- 把问题设定在能够得到答案的规模上
- 约束判断过程,而不只是约束文字
- 搭好骨架,并把许可信息变成可查询的内容
改动标题译自作者提交代码时写的英文原文,点击可查看原文。