番号解析中的特殊字符与分隔符处理
在检索语境里,命名族群的谱系视角常遇到连字符、空白、下划线等多种分隔符。本文给出四类分隔符归一化方案,比对 MIDE-500、MIDE 500、MIDE_500 三种典型输入,并整理三个边界误处理。番号解析的分隔符处理直接决定入库的一致性。示例编号仅作演示用途。 同族里可先看解析分隔符解析切解析失败与解析分隔符解析切数字段解析互为参照, 跨族则以番号结构与字段规则与番号核验流程与工作单做外部锚点。
四类分隔符类别
番号解析可能遇到半角连字符、全角连字符、下划线、单空白四类分隔符。四类语义等价,但入库前需统一。相关规范梳理见命名族群清点方法。分隔符:4 类归一:半角连字符
跨呈现层邻接读物(续)
分隔符规则映射到检索输入的分词边界:番号搜索语法要点给出输入分词边界对分隔符规则的响应。
跨呈现层邻接读物
分隔符规则在聚合站分类层也有等价约束:聚合站分类约束反射到分隔符规则的做法给出聚合站分类约束反射到分隔符的规则。
四类分隔符处理对照
下表按分隔符类别、Unicode 代码点、常见来源、归一目标对照:
| 类别 | 示例 | 常见来源 | 归一目标 |
|---|---|---|---|
| 半角连字符 | - | 规范输入 | 保留 |
| 全角连字符 | - | 中文输入法 | 转半角 |
| 下划线 | _ | URL 转义 | 转半角连字符 |
| 单空白 | | OCR / 手抄 | 转半角连字符 |
误处理一:把连续多个空白保留
OCR 输入常含多个空白。番号解析若保留多空白,会破坏后续正则匹配。以示例目录 4,200 条估算,多空白未归一会导致约 6% 匹配失败。相关规范见核验工作单交接要点。失败率:6%
误处理二:把连字符与下划线视为不同命名族
下划线常来自 URL 转义,语义与连字符相同。番号解析若不归一,会拉高目录条目数。相关辨析见番号分类维度。
误处理三:保留分隔符前后的非法空白
分隔符两侧不应有额外空白。番号解析应在归一时同时去除两侧空白。示例细节见大番号定义解读。
关于番号解析的常见问题
为什么统一到半角连字符
半角连字符在 URL、数据库、正则里都最安全。是否需要严格区分,取决于检索目标本身。
是否有命名族用其他分隔符
极少数早期命名族用点号或斜线,需按命名族约定单独处理。
归一化会不会丢信息
分隔符本身不承载命名族信息,归一不丢关键语义。两者能否互换使用,需结合具体检索场景判断。
Unicode 里还有别的连字符吗
有,如非断连字符 U+2011。番号解析建议一并归一。至于何时启用严格 Unicode 白名单,尚无统一约定。
边界与局限
本文只覆盖番号解析中分隔符归一化的公开命名部分,不涉及内容获取途径、许可核验或跨编号系统的映射。实践中还应记录归一化规则版本与采样时间戳,便于跨批次对齐。分类边界尚在讨论,示例编号仅作演示用途。
参考资料
- 参照 ISO 2108 编号标识命名规范中的字符白名单建议
- 参照 W3C URL 编码规范里的保留字与分隔符表述
- 参照 Unicode NFKC 规范的全半角与大小写归一化步骤
