番号的元数据表字段速查
番号元数据表以一条番号为主键,承载命名族、结构分段与状态标记三类字段。本文列出最小可用字段集与扩展字段清单,并对照番号库的字段组织与番号大全的列举维度说明差异。示例编号与统计为示范举例, 同族里可先看主词元数据表切定义脉络与主词元数据表切结构骨架互为参照, 跨族则以番号核验流程与工作单与近义词辨析速查做外部锚点。
字段清单与类型
最小可用字段集包含六项:主键、命名族、前缀、数字段、后缀、收录状态。以 MIRD-765A 为例,前缀 SSNI 属新式 4 位命名族,数字段 123,后缀 A 常代表版本迭代。字段扩展方式参考番号命名族群断层解读。主键:VARCHAR(20)命名族:ENUM状态:三值枚举
跨呈现层邻接读物(续)
元数据字段在聚合站抓取端有映射差:聚合站抓取字段与元数据的映射差。
跨呈现层邻接读物
元数据回显在检索结果里有独立的显示规范:检索结果元数据回显的规范。
跨呈现层的对照阅读
元数据在各呈现层承担的职责不同:大全批量元数据的合并规则覆盖大全跨源批量合并规则;库端元数据列的类型与约束给出库层列的类型与约束;聚合站抓取元数据字段映射是聚合站抓取端的字段映射;社区回帖线索的元数据抽取关注社区回帖抽取出的线索元数据;检索结果元数据回显规范规范检索结果端的回显。
三种收录形态的字段差异
元数据表、番号库与番号大全虽都承载番号数据,字段侧重却不一致。下表按主键粒度、必填字段数与扩展方式三个维度对照:
| 形态 | 主键粒度 | 典型必填字段 | 扩展方式 |
|---|---|---|---|
| 元数据表 | 单条番号 | 6-8 项 | 纵向加列 |
| 番号库 | 命名族+序号 | 12-20 项 | 横向分表 |
| 番号大全 | 维度键 | 3-5 项 | 按维度归组 |
状态位与来源标签
状态位常用三值枚举:已核验、待核验、有争议。以示例目录 8,600 条估算,已核验占约 63%,待核验约 29%,其余为有争议或退回记录。来源标签建议独立成列,避免与状态位耦合。字段设计参考番号索引结构。状态:3-value
字段命名与冗余取舍
命名族字段可选择原样字符串或映射整数,两者查询平均耗时相差约 12 毫秒。后缀建议原样存一列、拆分再存一列,避免检索时反复正则匹配。冗余策略详见分类框架要点与大番号命名边界。
关于番号元数据的常见问题
元数据表与番号档案是否等价
不等价。前者是数据结构,后者是研究性归档。是否需要严格区分,取决于检索目标本身。
可以只用主键索引吗
可以,但会牺牲命名族聚合查询效率。建议在命名族列建二级索引。
示例编号可以直接引用吗
本文示例仅供说明结构。至于何时启用真实值,应结合来源许可与合规要求判断。
是否需要为旧式短前缀单独建列
不必。旧式短前缀与新式长前缀共用同一列即可,通过命名族字段区分版本差异。
边界与局限
本文只覆盖字段结构与命名规范层面,不涉及内容获取途径、许可核验或跨编号系统的映射规则。分类边界尚在讨论,示例编号与统计为示范举例。
参考资料
- 参照 ISO 2108 编号标识命名规范中的结构分段建议
- 参照 W3C URL 编码规范里的保留字与分隔符表述
- 参照 Unicode NFKC 规范的全半角与大小写归一化步骤
