番号的规范化引用
番号引用规范指在正文、目录与参考区分别采用原样、归一化与出处标注三类写法的约定。本文对照番号库的引用惯例与数据来源分层图,附速查表与错误示例。本文虚构数据用于结构说明。
本文不涉及内容获取,只讨论公开命名与引用方法;示例编号仅供理解方法用。
番号引用的三种形态定位
原样引用保留发行方原始字符串,例如 HBAD-345;归一化引用先经 NFKC 与大小写统一,输出为 HBAD-345 这类可比对形态;出处标注引用在此基础上再附命名族与版本字段。相邻概念差别见定义与常见误解。形态:原样 / 归一化 / 标注
速查表:三种写法对照
下表按适用场景、必填字段与是否可回溯三个维度对照,供文档模板套用:
| 写法 | 适用场景 | 必填字段 | 可回溯 |
|---|---|---|---|
| 原样引用 | 正文行内 | 前缀 + 数字段 | 视上下文 |
| 归一化引用 | 目录条目 | 大写前缀 + 半角连字符 + 数字段 | 是 |
| 出处标注引用 | 参考区 / 复盘单 | 归一化串 + 命名族 + 版本 | 是 |
字段清洗流程见归一化与字符清洗。
归一化前的字符清洗
示例目录 9,200 条引用中约 12% 存在全角数字或全角连字符,直接入库会破坏字符串匹配。清洗顺序建议为:NFKC 归一 → 前缀转大写 → 分隔符统一为 - → 去两端空白。顺序:NFKC → 大写 → 分隔 → 去空白
常见错误引用示例
典型错误包括:把 ssni-123 直接入清单而不做大写;用中文短横 — 替代半角连字符;省略后缀后又在检索时补写。这些错误会导致同一条编号在聚合库中出现重复条目。校验:字符集 + 大小写
关于引用规范的常见问题
正文里的番号引用要加代码样式吗
建议加。等宽字体可避免全角字符与半角字符的视觉混淆。
三种写法必须都用吗
不必。技术文档常见组合是正文原样加参考区标注两种;是否需要严格区分,取决于读者的检索目标。
版本字段应写在哪
建议写入出处标注段而非归一化串本体,避免破坏字符串匹配。
状态标记应放在哪一列
放在标注段末列。状态可取已核验、待核对或存疑三值,便于清单复盘。
边界与局限
本文只覆盖引用书写层面的约定,不涉及内容获取、许可核验或跨编号系统的映射。分类边界尚在讨论,示例值仅作说明用途。
参考资料
- 参照 ISO 690 引用文献的字段构成建议
- 参照 W3C URL 编码规范里的保留字与分隔符定义
- 参照 Unicode NFKC 归一化对全半角与大小写的处理规则
