区分重复文件、重复谱页与不同版本,用站内实例填写去重判断记录。
重复文件怎样判断
同一份PDF可能改名后再次上传。本站入库时记录字节数和文件哈希,可以判断字节完全一致的副本。重命名不改变文件内容;但重新压缩或重新扫描会改变哈希,因此哈希不同也不能证明是不同底本。
重复页面怎样处理
《春草堂琴谱》扫描第28、29页、《龙湖琴谱》第11、12页均有内容重复的画面。这是文件内部的扫描状况。平台保留原文件和原页序,并做说明,避免已有引文的页码发生变化;阅读定位优先指向第一次清楚出现的位置。
同名不同版本怎样处理
杨抡本《太古遗音》与谢琳同名谱集线索不应合并。判断一份新资料时,先查责任者、刊抄信息、馆藏编号,再比较卷端和版式。同名不同本可以各自建立资料卡;同一本的不同扫描则应说明关系,避免把扫描数量包装成作品数量。
可直接填写的判定单
候选资料:书名、责任者、来源地址;本站可能对应项:资料页及原件编号;相同证据:逐项填写;不同证据:逐项填写;文件比对结果:相同、不同或未取得文件;页面抽检:页码与观察;建议:沿用、另立版本或待复核。
两个实际判定示例
例一:同一PDF换了文件名,字节数及SHA-256相同。建议沿用既有原件,补充新的来源线索,不再次计数。
例二:题名相同,责任者不同,其中一份尚无原件。建议保留两个书目身份,把未取得原件的一项标为线索,不宣称有两份可阅读原件。
提交前最后核对
结论必须写出比较依据和未查部分。只凭搜索引擎的书名摘要不能决定合并;只看到两张相似封面也不能决定删除。平台资料计数以实际发布的原件和版本归组为准,研究性的判断由复核人确认。
平台编辑原创教学案例;原页观察依据本站已入库影像,示例记录不作为真实参与者成果。