数据来源与开放许可

本站仅导入许可证允许再利用的公开数据,并保留来源、许可及导入记录。不同来源的数据经过格式标准化、繁简映射、去重和站内关联,不代表原项目对本站提供背书。

102,998 个汉字392,072 个词条42,892 个成语279,564 条关系

Unicode Unihan

Unicode Terms of Use

用于汉字编码、普通话读音、部首、笔画、繁简异体、仓颉、四角号码、区位码与大陆电报码等基础属性;kGradeLevel 用于香港学校年级字表及派生词表,字典索引字段映射了 70,342 个本地《康熙字典》页码索引。结合 MIT 字表的具体部首形态,生成 264 个主部首及变体路由。

来源:Unicode Unihan 数据

CC-CEDICT

CC BY-SA 4.0

用于简繁词形、拼音和英文释义,共构成本地汉语词典及词语与汉字的关联索引。为避免中文释义导入时覆盖英文内容,本站另行保留了 115,204 条可追溯英文翻译。

成语专项审计扫描 124,726 个词头,识别 4,956 个明确带 (idiom) 标记的四字词,限定在已有开放中文释义的词形后接受 3,329 个;其中 3,267 个已存在,新增 62 个成语,共保留 3,329 条标记证据。标记只用于确认成语身份,不覆盖中文释义及其原来源。源文件 SHA-256 为 836c1bb7c2708b603ed85ca40b489ecc960b71ecaf6c9f8e5dd613d4da577d32。

来源:CC-CEDICT 项目

中文维基词典结构化导出

CC BY-SA 4.0

使用 Kaikki/Wiktextract 提供的中文维基词典结构化导出,逐行扫描 2,914,256 条记录,识别 68,647 个含中文释义的汉字词形;新增 35,797 个词条并补充 18,274 个既有词条。成语审计识别 12,779 条带成语类标记的记录,保守接受 4,554 个标准汉语成语,其中保留 3,639 个既有高优先级词条并新增 915 个成语。另有 1,479 个严格成语带有包含本词形的中文用例,精确匹配 1,479 个本地成语,并为原书证为空的 533 个词条补充字段级可追溯书证;进一步保留 1,674 条带明确出处的补充书证,覆盖 1,055 个成语,实际映射 1,674 条。

词语用例专项导入覆盖 10,610 个本地词语,共保留 20,579 条包含本词形的去重用例;其中 5,722 个词语具有明确出处,共 10,335 条带出处用例,实际写入 20,579 条。按完全相同词形关联后,可为 1,703 个成语提供 2,696 条补充书证,其中 1,947 条带出处;在没有专用补充书证的词条中,覆盖 652 个成语和 856 条用例。用例独立存储,不覆盖主要释义,源文件 SHA-256 为 c3fd1ff3c7b2cd9f18ba65c7a985074851dee613613cbe87486af2f063efbb15。

词源专项扫描 2,914,256 条记录,从 4,665 条严格成语记录中精确匹配 4,609 个本地成语;共有 1,361 个词条获得词源、字面义或典籍引文,其中 792 个含词源正文、790 个含字面义、619 个含典籍引文,共保留 646 条去重引文。源文件 SHA-256 为 c3fd1ff3c7b2cd9f18ba65c7a985074851dee613613cbe87486af2f063efbb15。当前精确映射 279,564 条双向词语近反义关系,并派生 4,108 条成语关系,覆盖 2,371 个成语。

来源:Kaikki 原始数据

pwxcoo/chinese-xinhua

MIT License

用于成语、歇后语、中文释义、郑码和笔顺编号。词语全库审计了 264,434 条记录,接受 262,481 个仅含汉字且带中文释义的唯一词形,新增 221,263 个词条并更新 26 个释义;每个词条保留独立来源归属。另精确映射 16,141 个汉字释义,并从明确标注出处的行中提取 3,483 个本地《说文》引文;引文不等同于完整古籍原文。

来源:chinese-xinhua 项目

清华大学 THUOCL 成语词表

MIT License

固定到提交 a30ce79d895d01ab5132a5c74c29703ff7efb4cc,审计 8,519 行并接受 8,519 条规范成语频次,精确匹配 7,627 个本地成语。频次只用于热门推荐及列表中的常用度排序,不替代词义、出处或分类证据。源文件 SHA-256 为 c339d5d6e37d4f8ecdcb82f2a02b7fdfc66796f0a5215155f2aff8a77e89a7eb,许可证 SHA-256 为 db4b8cca414db4cf487b933d07a0514f77caf44f9f3d392f2bc9d7ba0d511c58。

来源:THUOCL 项目与许可证

Shuowen.org《说文解字》数据

Apache-2.0

固定到提交 6553a350763ce4feca2c5d1cc2cad7e594dc2975,完整导入 9,833 个字条、1,248 条重文和 22,898 条段玉裁注,保留卷部、反切、构件及徐铉徐锴注。13,013 条正字、重文和别名映射覆盖 12,889 个本地 Unicode 字头;简繁字共用正文时仍保留其检索关系,不改写原始正字。

来源:Shuowen.org 数据与许可证

kangxi-dictionary《康熙字典》数据

MIT License

审计 Excel 原始表 48,709 行,去重后导入 46,836 条繁体字头、简体映射、卷部路径、康熙笔画和原文,覆盖 46,816 个 Unicode 正字。源文件 kx_full.xlsx 的 SHA-256 为 046e656c77a832f718da8e2db0759ca31cb7cb3a4b4407eb960f9f3841660420,本地许可证文件的 SHA-256 为 3389c5a80068a79b8362c348ca199949031877f3e5119c57d00ae68854e0254e。

来源:kangxi-dictionary 数据与 MIT 许可证

Rime Terra Pinyin

LGPL-3.0 / CC BY-SA 3.0

固定到提交 8a2c895ad7ee8e2b137d91be77f18f86b04d7fc9,扫描 99,329 行并接受 99,151 行格式有效的纯汉字读音,精确匹配 24,717 个本地词形,仅为原先无拼音的 3,730 个词条补充带声调参考读音。上游说明部分标音由程序生成,本站不将其作为权威正音。

来源:Rime Terra Pinyin 项目与许可证

Rime wubi86

LGPL-3.0

用于五笔 86 编码查询。上游 AUTHORS 说明该字表派生自 LGPL 数据,并基于王永民的 Public Domain 原始工作。

来源:Rime 五笔项目与许可证

Hanzi Writer 与 Make Me a Hanzi

MIT / Arphic Public License

汉字详情的交互笔顺使用 Hanzi Writer 渲染;9,575 份本地字形数据用于笔画动画,另有 9,565 条 Make Me a Hanzi 字形拆分与字源元数据用于详情页。页面只加载本地文件,不向第三方发送查询字。

来源:Hanzi Writer 项目 来源:Make Me a Hanzi 数据

qrcode-generator

MIT License

用于全站“手机查看”功能,在浏览器本地生成当前页面二维码;二维码内容仅为当前 URL,不向第三方服务发送页面或查询内容。

来源:qrcode-generator 项目

再利用说明

标注为 CC BY-SA 4.0 的内容在署名、相同方式共享等条件下再利用。Unicode 数据适用 Unicode Terms of Use;《说文解字》结构化数据适用 Apache-2.0;康熙字典结构化数据、THUOCL 频次、中文释义、成语、歇后语、郑码和笔顺编号适用各自的 MIT License;Rime wubi86 适用 LGPL-3.0;Hanzi Writer 与 qrcode-generator 适用 MIT License,笔顺字形数据适用 Arphic Public License。成语谜语、成语对联与成语之最为本站整理的精选映射。本站自行编写的页面结构、检索逻辑和数据清洗代码不改变上游数据各自的许可证。

发现来源标注、许可或内容归属有误,请通过在线反馈告知。

手机查看

留言反馈
反馈类型