番号分类框架速查
分类框架指按稳定维度将大量番号编入互不重叠层级的方法体系。本文以命名族、发行方与时期三条主线组织框架,配合番号库的结构化编目与番号的语义分层展开讨论。示例编号仅作演示用途。 同族里可先看主词分类维度切定义脉络与主词分类维度切结构骨架互为参照, 跨族则以番号核验流程与工作单与近义词辨析对照做外部锚点。
分类框架的目标与边界
一套可用的分类框架需同时满足三项要求:互不重叠指同一条编号只能落入一层的一个节点;可扩展指遇到新前缀或后缀时不必推翻既有层级;可回溯指每一层的划分依据均可查考。这三项要求与番号大全的分类维度是并列关系,前者关心层级组织,后者关心平面枚举。维度:三主线粒度:可拓展
跨呈现层邻接读物(续)
分类映射到聚合站栏目会做压平:聚合站栏目对分类维度的压平映射可作参考。
跨呈现层邻接读物
分类维度沿社区话题重构会有新增分支:社区讨论对分类维度扩展的贡献可作参考。
跨呈现层的对照阅读
分类逻辑在不同呈现层会长出不同分支:大全分类维度的横向铺陈用横向维度铺陈可穷举面;库表分类的枚举与外键设计靠外键与枚举把分类固化;聚合站分类映射到栏目的归位把分类映射到站点栏目归位;社区讨论重构分类的话题维度让分类维度沿讨论话题重构;检索路径中分类的召回场景让分类进入检索召回场景。
按命名族划分:前缀维度
命名族以前缀字母段为主键。以 MIDE、SSNI、STARS 三个前缀为例,分别对应 4-5 位字母长度的新式命名族;早期的 3 位纯数字或 2 位短前缀属旧式命名族。示例目录 44,200 条数据中,4 位字母前缀占比约 61%,3 位字母前缀占比约 24%,旧式短前缀占比约 15%。命名族维度的规范化步骤见番号命名族群总览。前缀:3-5 位
按发行方划分:来源维度
发行方是命名族的上一层级。同一发行方可维护多条命名族,例如发行方 A 通常同时运营 3-5 条 4 位字母前缀命名族,发行方 B 常以 4 位前缀加双字母后缀构成子序列,发行方 C 则倾向沿用旧式 3 位命名族并新增校验位。发行方维度不完全等价于命名族维度,交叉现象与命名族族谱见大番号定义的口径。
按时期划分:编号演变
以年份为切片:2010 年前多为 3 位纯数字编号;2015 年后 4-5 位字母加数字混合命名占主流;2020 年后开始出现 5 位数字加双字母后缀的复合结构。时期维度对应目录版本控制,其检验平均耗时在示例数据集中约 58 毫秒,可作为回归测试基线。时期:3 段
番号分类的层级化组织
三条维度组合形成三层层级:外层按时期分片,中层按发行方分组,内层按命名族分桶。以示例数据估算,44,200 条番号在三层结构下平均桶大小约 38 条,检索深度不超过 3 跳。三种主键排列方案的对照如下:
| 方案 | 外层主键 | 桶均条数 | 检索深度 |
|---|---|---|---|
| 时期 → 发行方 → 命名族 | 时期 | 约 38 | 3 跳 |
| 发行方 → 命名族 → 时期 | 发行方 | 约 55 | 3 跳 |
| 命名族 → 时期 → 发行方 | 命名族 | 约 42 | 3 跳 |
层级排序会显著改变桶膨胀率,最终选型的对照方法见近义词辨析走查。
关于分类框架的常见问题
分类维度可以由使用者自定义吗
可以在稳定主键之外增补辅助维度,例如标签、地区或版本号;但主键维度应保持稳定,避免层级频繁重构带来的回溯成本。
一条编号是否可能落入多层
在互不重叠原则下,同一编号只归一层的一个节点。跨版本命名族的编号复用属于例外,是否需要严格区分,取决于检索目标本身。
时期切片如何确定分界年份
不以日历年份为准,而以命名族版本迭代的显著节点为界;分界值以示例数据估算,实际应结合真实目录调整。
分类框架是否需要与外部标准对齐
非必须。外部编号标准(如 ISO 2108)与本文讨论的命名族体系并不重合。至于何时启用外部标准映射,尚无统一约定。
边界与局限
本文只覆盖公开命名与检索层面的分类方法,不涉及内容获取途径、许可核验或跨编号系统的映射。分类边界尚在讨论,示例目录规模、桶均条数与耗时仅作演示用途。
相关阅读:按前缀分桶的识别路径,可对照本节内容进一步展开。
相关阅读:语法解析驱动的分类归位,可对照本节内容进一步展开。
参考资料
- 参照 ISO 2108 编号标识命名规范中的层级分段建议
- 参照 W3C URL 编码规范里的保留字与分隔符表述
- 参照 Unicode NFKC 规范的全半角与大小写归一化步骤
