番号识别里的命名族判定流程
在检索语境里,番号命名族群手册的命名族流程指按四段拆分逐层核验候选命名族的过程。本文给出完整流程,比对 MIDE-500A 与 SSNI-123 两种典型输入,并整理三个常见误判。番号识别的准确度由四段完整对齐决定。示例编号与统计为示范举例, 同族里可先看识别识别命名族切识别前缀与识别识别命名族切识别版本互为参照, 跨族则以番号的定义与常见误解与番号核验流程与工作单做外部锚点。
流程与四段拆分
番号识别的命名族流程从四段拆分开始:前缀段承载命名族版本信息,分隔符段用于兼容全半角变体,数字段承载序号规模,后缀段承载版本或分卷标记。示例 MIDE-500A 拆分后前缀 MIDE、数字段 500、后缀 A;示例 SSNI-123 无后缀。相关规范梳理见命名族群的对照卡。段数:4校验:3 级
跨呈现层邻接读物(续)
识别命名族在检索层需要独立归并:检索场景对识别命名族的归并调用。
跨呈现层邻接读物
识别命名族在聚合站栏目里另有一套对齐口径:跨聚合站命名族对齐的合并原则。
命名族匹配三级校验
三级校验按代价从低到高排列:前缀族命中、数字段范围核对、后缀标记回溯。下表按每级的通过率与耗时估算对照:
| 级别 | 操作 | 典型通过率 | 示例耗时 |
|---|---|---|---|
| 一级 | 前缀族匹配 | 约 71% | 3 毫秒 |
| 二级 | 数字段范围核对 | 约 92% | 7 毫秒 |
| 三级 | 后缀标记回溯 | 约 98% | 12 毫秒 |
误判一:跳过数字段范围核对
常见做法是命中前缀族就直接结束番号识别,但同前缀往往覆盖多个数字段区间。以示例目录 12,600 条估算,跳过二级校验会把约 21% 条目并入错误命名族。修正方案见番号库归一化。错并入率:21%
误判二:把连字符差异当命名族差异
输入中的 - 与全角 - 都属于分隔符段,不改变命名族归属。番号识别若把连字符差异当独立命名族,会拉高目录条目数。相关辨析见元数据规范的字段清点。
误判三:后缀被当作命名族版本
后缀常用于版本或分卷,但不总是命名族版本升级。番号识别应结合发行方文档判定后缀语义。大番号定义的走查给出更多命名族层级示例。
关于番号识别的常见问题
四段拆分能否省略
不能。省略任何一段都会让番号识别在跨版本命名族里失准。是否需要严格区分,取决于检索目标本身。
命名族表由谁维护
多由发行方文档与研究者社区维护,跨发行方缺乏统一表。
命中一级还需要跑三级吗
如果目标只是粗过滤,可停在一级;若要归档写入,建议跑到三级。两者能否互换使用,需结合具体检索场景判断。
后缀语义有统一约定吗
没有跨发行方的统一约定。至于何时启用严格后缀规则,尚无统一约定。
边界与局限
本文只覆盖番号识别命名族流程的公开命名部分,不涉及内容获取途径、许可核验或跨编号系统的映射。实践中还应记录时间戳、来源域与匹配置信度,便于跨批次对齐。分类边界尚在讨论,示例编号与统计为示范举例。
参考资料
- 参照 ISO 2108 编号标识命名规范中的结构分段建议
- 参照 W3C URL 编码规范里的保留字与分隔符表述
- 参照 Unicode NFKC 规范的全半角与大小写归一化步骤
