数字人文
数字人文最重要的变化,不是把更多书、图像与档案搬上网,而是把数字化选择本身视为证据条件。第一幕用远读、主题模型、历史GIS、网络分析、TEI和IIIF扩展可计算对象;第二幕追问馆藏数据包、去殖民描述、知识图谱、原生数字保存、低资源语言和大模型阐释如何被核对。语料边界、版本、权利、缺失与执行环境因此不再是技术附注,而是人文结论的一部分。
第一幕扩展了人文材料的尺度与形式:从远读和主题模型到空间、网络、校勘与互操作图像。共同问题是,模型一旦改变材料的可见方式,语料边界和编码选择便必须成为解释的一部分。
甲、远读Distant Reading
在2005年前后的语料、档案、馆藏、知识图谱与数字保存里,少数典范作品曾是最省事的解释。就数字该转向的对象而言,只要该未登记群体仍无独立编码,进入分析的文本数/理论上相关的全部文本数的改善就无法区分真实转向与流程清洗。
核心主张是:文学史转向主要由大规模文本分布的形状决定,而不是由少数典范作品决定。理论责任被压在大规模文本分布而非典范个案上,其他变量只有在能改变这一比率时才进入解释。若固定大规模文本分布而非典范个案后方向仍在,或反向操纵它却不改变结果,这一单因命题就失去判别力。
源行中的提出、争议与更新分别来自Moretti(2005)、Da(2019)、Underwood(2022)。远读以数千至数万部小说的体裁、词频和出版时间形成趋势线;批评者复算后指出分类与历史解释会改变方向,故模型必须公开语料边界。本项把证据压到该复核口径上:分子记录进入分析的文本数,分母固定为理论上相关的全部文本数。这样既能比较语料、档案、馆藏、知识图谱与数字保存,也能看见该未登记群体是否被悄悄移出分析。数字这一制度安排的结构读数保留2个可分别核对的对象:文学史转向主要由大规模文本分布的形状决定;任一对象缺席都不能由其余项代填。
最锋利的边界是:当数字化语料集中于畅销与英语作品时,规模增大会反而放大典范偏差。这说明数字化选择、版权、语言资源、平台迁移与分类权力不是背景噪声,它可能倒过来塑造大规模文本分布而非典范个案。判别设计应在同一理论上相关的全部文本数下分别改变两者,观察进入分析的文本数是否按预测反号。
在报告和治理上,该未登记群体应成为独立字段,不能并入“其他”或“不适用”。同时公开该复核口径及排除理由;若空栏扩大而中心指标改善,档案馆、研究者、来源共同体、公众与算法应先解释选择过程,再谈成效。就文学史转机制的遗漏记录而言,复核表还要标明退出日期、原始责任人和未纳入理由。
本项把大规模文本分布而非典范个案放在S位,对方把多域能力储备放在E位;若两种读数在同一对象上相反,转换条件应从这些漏记对象与临床未测的沟通、数字使用与文化活动能力的交集寻找。把文学史转机制放到另见第 390 号第 19 条『患者叙事进入大规模文本分析』旁核验:先对齐对象、时间窗和责任人,再检查文学史转机制的核心判断在另一套分母中是否仍同向。
乙、主题模型的人文解释Topic Models as Humanistic Interpretation
主题模型的人文解释出现之前,数字人文常从困惑度最低出发,把主题—语料—解释循环留在解释末端。2003年后的异常是:无人命名、混合语言和被删除的低频主题越多,中心读数反而越整齐。若不重做文本、版本、元数据、权利、缺失、代码和执行环境,这种整齐只能来自选择。核查主题模型机制时,在该转向中,这一点把档案馆、研究者、来源共同体、公众与算法从结果使用者变成对象定义的共同责任者。
主题模型的解释力主要由研究者如何在词分布、文献样本和历史问题之间循环校准决定,而不是由困惑度最低决定。这句话故意把立场写窄:决定历史解释是否可核对、可重做且不抹平差异的是主题—语料—解释循环。因此必须比较有无该因素时可由独立编码者一致命名的主题数/全部模型主题数的差,而不能用更多协变量把相反结果事后吸收。
证据链由Blei、Ng与Jordan(2003)、Blei(2012)、Boyd-Graber、Hu与Mimno(2017)三笔材料构成。LDA把文档表示为主题混合、主题表示为词分布;在人文项目中,主题数从几十到数百都可产生可读标签,但统计拟合更好并不保证历史意义更强。与其只写“效果显著”,不如读取上述分子—分母;分子记录可由独立编码者一致命名的主题数,分母固定为全部模型主题数,因而分母变化会立刻暴露。主题模型机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
反向条件已经写在方法自身之中:当停用词、切分和主题数由结果反向选择时,稳定主题会反而成为分析者选择的产物。因此不能只在顺利场景验证主题模型的人文解释;还要把数字化选择、版权、语言资源、平台迁移与分类权力设为预先登记的压力条件,并保留没有通过流程的对象。在主题模型机制这条证据链上,围绕该研究线索,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
实践改动可以很具体:为这些漏记对象建立数量、原因、去向和后续状态四列,并与上述分子—分母同步发布。这样语料边界、版本溯源、权利说明、可执行工作流与共同体审阅才能区分真实改善、风险转移和记录缺口。
二者都默认各局部环节分别改善,系统整体就会随之改善,但本项以主题—语料—解释循环解释这一比率,对方则以跨域年度监测解释按期更新指标数/全部承诺指标数;第三变量可能藏在两边未设字段的部分,这里由主题—语料—解释循环承担证伪风险。
丙、文化组学Culturomics
早期研究把文化组学压缩成孤立引文,于是档案馆、研究者、来源共同体、公众与算法只需报告一个结论。真正刺破这一口径的是OCR不可读、非拉丁文字与未入库出版物:它既不属于成功,也不被算作失败,却足以改变历史解释是否可核对、可重做且不抹平差异。在宏观文化机制这条证据链上,围绕该转向,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
本项把争论落到一个可推翻的判断:宏观文化变化主要由跨数十年词项频率的系统变化决定,而不是由孤立引文决定。可检索词项的长期频率若真是决定项,便应在语料、档案、馆藏、知识图谱与数字保存改变时留下同一方向的读数;若替代机制无需它也能复现结果,主张即告失败,在文化组学中可用目标词项出现次数直接检验。
Michel等(2011)、Pechenick、Danforth与Dodds(2015)、Koplenig(2017)给出从提出到争议再到近年修正的连续线索。最适合复算的量是目标词项出现次数/同年全部可检索词数,其中分子记录目标词项出现次数,分母固定为同年全部可检索词数,可把平均改善与样本选择区分开。宏观文化机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
当语料构成随年份改变时,词频趋势会反而测到出版结构。这一反号不是“效果变弱”,而是因果方向被改写,同时把这组账外材料留在分母。若在该条件下该复核口径仍不变,现有边界说被削弱;若确实翻转,主张只能在更窄适用域成立,这里由可检索词项的长期频率承担证伪风险。对宏观文化机制做反向检验,换言之,文化组学的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。
数字人文的账本需要补上该未登记群体。它们不是注脚,而是决定同年全部可检索词数如何形成的对象;若仍被删除,上述分子—分母便无法支持历史解释是否可核对、可重做且不抹平差异。这也解释了为什么上述机制在不同制度中可能指向不同对象。
共同前提为各局部环节分别改善,系统整体就会随之改善;差别在于E位的可检索词项的长期频率与S位的跨域年度监测争夺主因。若同时成立,就必须追踪这些漏记对象何时转化为没有国家序列、没有性别分解和未进入正式市场的食物活动。把宏观文化机制放回原窗口,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于该未登记群体是否获得与成功样本同等的记录权。
丁、文体计量与作者归属Stylometry and Authorship Attribution
围绕文体计量与作者归属,旧账本默认主题词相似足以代表全貌。2009年前后积累的材料却显示,词项、关系、图像区域、异文与可执行对象一旦换条件便会改向,而合著、编辑重写和匿名集体文本长期没有位置;因此需要改的首先是分母。对文体计量作者归属做反向检验,换言之,该转向的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。
这里不采用“多因素都重要”的安全表述,而明确主张作者归属主要由功能词、字符序列和句法习惯的跨题材稳定性决定,而不是由主题词相似决定。检验重点是跨题材稳定的文体特征能否独立解释正确归属文本数/全部待归属文本数的变化,并在控制数字化选择、版权、语言资源、平台迁移与分类权力后仍保留增量。
文体计量与作者归属的转向并非只靠概念推进。基准研究用数百至数千个功能词与n-gram进行封闭集和开放集测试;同域准确率可超过90%,但跨体裁、合写和翻译会显著下降。源行列出的Stabamatatos(2009)、Koppel、Schler与Argamon(2009)、Savoy(2020)分别承担原始命题、边界与更新。核心读数采用上述分子—分母;分子记录正确归属文本数,分母固定为全部待归属文本数,因此不同材料可以在同一坐标上比较。
本项自己的限制是当作者刻意仿写或编辑深度增加时,特征越精细会反而更易过拟合版本。它迫使数字人文区分驱动与被驱动:跨题材稳定的文体特征究竟先于变化,还是被数字化选择、版权、语言资源、平台迁移与分类权力制造出来,应由时间顺序和对照条件裁决。把文体计量作者归属放回原窗口,其也解释了为什么文体计量与作者归属在不同制度中可能指向不同对象。
面向档案馆、研究者、来源共同体、公众与算法,最低披露要求应包括上述分子—分母、所有排除规则以及这些漏记对象的原始数量。只有把失败流程保留下来,才可能复算上述机制在真实条件中的净效应。就文体计量作者归属的外推边界看,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于该未登记群体是否获得与成功样本同等的记录权。
它与这一制度安排同属前提族02,却用自主项目连续性而非跨题材稳定的文体特征决定方向。比较这一比率和系统自主完成作品数/全部公开作品数,可以寻找从S位转到D位的阈值。只要这些漏记对象仍无独立编码,上述分子—分母的改善就无法区分真实转向与流程清洗。
戊、空间人文与历史GISSpatial Humanities and Historical GIS
数字人文过去处理空间人文与历史GIS时,往往先把地名在文本中出现与否定为主对象,再把其余差异视作噪声。问题在于,消失地名、移动边界和无法地理编码的叙述正好集中在这些“噪声”中,它们决定了结果能否离开语料、档案、馆藏、知识图谱与数字保存。把空间人文历史GI放回原窗口,其也解释了为什么该转向在不同制度中可能指向不同对象。
历史解释的方向主要由地点、移动与尺度关系如何重建决定,而不是由地名在文本中出现与否决定。从位置上说,本项把历史对象的时空关系当作主要判决点,要求档案馆、研究者、来源共同体、公众与算法说明它如何把其他条件传递到可定位到可信历史坐标的记录数/全部含地名记录数。若这条传递链找不到,相关性不能冒充机制,同时把这些漏记对象留在分母。
从Bodenhamer、Corrigan与Harris编(2010)、Gregory与Geddes编(2014)、Murrieta-Flores等(2023)可以追到主要证据。历史GIS把地名表、旧地图和人口资料叠加,可在街区、区域和帝国尺度得到不同模式;地名消歧与边界漂移会改变聚集结果。本项不以单个峰值结算,而用上述分子—分母;分子记录可定位到可信历史坐标的记录数,分母固定为全部含地名记录数,同时要求把这组账外材料保留在流程日志中。空间人文历史GI的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
争议集中在这条可检查的反例:当现代边界投射到历史空间时,地图精度提高会反而制造虚假连续性。最小检验不是再加一个协变量,而是建立一个能让历史对象的时空关系失去优势的条件,并比较这一比率是否换号。就空间人文历史GI的外推边界看,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于该未登记群体是否获得与成功样本同等的记录权。
制度层面的直接后果是:这些漏记对象不得继续由研究者自由处理。应在语料边界、版本溯源、权利说明、可执行工作流与共同体审阅中预设编码,并说明它对该复核口径的影响,否则表面进步可能只是把困难对象移出视野。
若实验只看一个分母,这组账外材料和未被记账的照护时间、家庭内分配和季节性饥饿会被误当成无关余数。把空间人文历史GI放到另见第 194 号第 1 条『新思想 1 · 记录连续体 —— 记录不是先生成后归档,而是同时存在于多个层次』旁核验:先对齐对象、时间窗和责任人,再检查空间人文历史GI的核心判断在另一套分母中是否仍同向。
己、历史网络分析Historical Network Analysis
2005年以前的常见做法,是用中心性排名替代历史网络分析本身。这样便于比较,却把数字化选择、版权、语言资源、平台迁移与分类权力从因果链中剪掉;尤其未保存信件、非正式关系和没有姓名的中介者连例外都算不上,只在数据清洗后消失。就历史行动机制的外推边界看,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于该未登记群体是否获得与成功样本同等的记录权。
命题的锋口在于关系资料的覆盖与方向,不是泛泛的“综合影响”:历史行动结构主要由关系网络的缺边、方向和时间切片决定,而不是由中心性排名决定。只要同一有来源可核对的关系边数/全部推定关系边数可由另一条路径在没有该因素时得到,当前理论就必须让出一部分解释权。
现有实证由Lemercier(2005)、Düring等编(2016)、Grandjean(2021)相互校正。书信、贸易和社团资料可形成数百至数万节点网络;同一人物的中心性会随边界、缺失档案和时间窗显著变化,动态网络常推翻静态“关键人物”叙事。这些结果最终需要落在上述分子—分母上,因为分子记录有来源可核对的关系边数,分母固定为全部推定关系边数,能防止只公布最顺利的一组。
历史网络分析并非无边界成立。当档案保存偏向精英时,中心性会反而奖励留下记录的人。若研究只报告平均改善而不展示这一条件,历史解释是否可核对、可重做且不抹平差异会把选择性样本误认成稳定机制。围绕历史行动机制,只要这组账外材料仍无独立编码,这一比率的改善就无法区分真实转向与流程清洗。
对历史网络分析的应用评价,应把该未登记群体从余数提升为观察对象。主表既列该复核口径,也列这一空栏占比;二者反向变化时,结论必须暂停,在该转向中可用有来源可核对的关系边数直接检验。沿历史行动机制的责任链,在该转向中,这一点把档案馆、研究者、来源共同体、公众与算法从结果使用者变成对象定义的共同责任者。
共享前提是一个汇总读数足以代表多层对象的真实状态,但本项的E位机制与对方的D位机制方向不同。两者都真时,新的研究对象不是折中值,而是两种空栏之间的转换过程,同时把这些漏记对象留在分母。复算历史行动机制之前,围绕本项证据,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
庚、TEI与数字校勘本TEI and Digital Scholarly Editions
理解TEI与数字校勘本的障碍,不是缺少更高精度的读数,而是旧框架把页面看起来像原书当成唯一入口。围绕TEI数字校勘,只要该未登记群体仍无独立编码,被显式编码的异文数/校勘发现的全部异文数的改善就无法区分真实转向与流程清洗。
数字校勘的可信度主要由异文、删除、补写和不确定性是否被显式编码决定,而不是由页面看起来像原书决定。这使可声明的文本差异编码承担可识别责任:它被改变时,词项、关系、图像区域、异文与可执行对象也应按预测改变;它不动而结果大变,则说明真正驱动来自别处,在TEI与数字校勘本中可用被显式编码的异文数直接检验。
提出者、反对者与后续工作可分别在TEI Consortium(2007)、Pierazzo(2015)、Bleier等编(2023)中核对。TEI P5提供数百个元素表达版本、人物、地点与编辑责任;项目可同时呈现外交转录和规范文本,但编码决策会改变检索与统计结果。本条据此选用上述分子—分母作为共同刻度;分子记录被显式编码的异文数,分母固定为校勘发现的全部异文数,而非把不同分母的“提升”混成同一件事。TEI数字校勘的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
边界判决应围绕当项目只编码可显示部分时,结构化程度上升会反而隐藏编辑判断展开。这里数字化选择、版权、语言资源、平台迁移与分类权力从环境变量变成反向因果来源;只有把它与可声明的文本差异编码交叉操纵,才能知道谁在推动谁。沿TEI数字校勘的责任链,在TEI与数字校勘本中,这一点把档案馆、研究者、来源共同体、公众与算法从结果使用者变成对象定义的共同责任者。
可操作的改进不是再写一句限制,而是让这些漏记对象进入数据字典、预算和复核流程。档案馆、研究者、来源共同体、公众与算法由此可以追踪它是否被转移给别的群体、别的时间或别的机构。围绕上述机制,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。TEI数字校勘的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。对TEI数字校勘的第三方复算还应保留原版本号与时间窗,使口径变更可被追踪。
把TEI数字校勘放到另见第 535 号第 19 条『无障碍共创:残障者不是边缘测试组,而是系统共同设计者』旁核验:先对齐对象、时间窗和责任人,再检查TEI数字校勘的核心判断在另一套分母中是否仍同向。
辛、IIIF互操作图像基础设施IIIF Interoperable Image Infrastructure
在语料、档案、馆藏、知识图谱与数字保存中,IIIF互操作图像基础设施曾被写成一个由是否上线缩略图决定的封闭问题。后来出现的反例都指向同一缺口:没有稳定标识、权限变化和未发布原图的对象没有被编码,档案馆、研究者、来源共同体、公众与算法因而看不到结果是在何处被筛选出来的。沿跨馆藏研机制的责任链,在该转向中,这一点把档案馆、研究者、来源共同体、公众与算法从结果使用者变成对象定义的共同责任者。
本项选择了一个会输的说法——跨馆藏研究主要由图像、区域、顺序和注释能否通过开放清单互操作决定,而不是由是否上线缩略图决定。可寻址图像区域与清单不是附加解释,而是决定方向的核心;观察到它与可由同一客户端读取的对象数/全部数字对象数脱钩,便足以否定当前版本。
IIIF让研究者以URL请求图像任意区域和尺寸,并把多页对象、注释与顺序装入Manifest;全球数百机构采用,但认证、版权和稳定URL仍不一致。这组发现由IIIF Consortium(2014)、Snydman、Sanderson与Cramer(2015)、IIIF Consortium(2024)提供出处。跨馆藏研机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
方法学上最重要的警告是:当机构更换服务器或权限时,标准化URL会反而变成大规模断链点。所以验证IIIF互操作图像基础设施必须包含故意制造失败的压力测试,不能只复制原论文最有利的设置。复算跨馆藏研机制之前,围绕该研究线索,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
上述分子—分母只有与这些漏记对象同时公开才有解释力。前者显示中心表现,后者显示被流程遗弃的部分,同时把该未登记群体留在分母;两张表合并,才构成历史解释是否可核对、可重做且不抹平差异的完整账本。按跨馆藏研机制的对象表,换言之,IIIF互操作图像基础设施的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。跨馆藏研机制的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。
两项都把文本、代码或模型被复制后,实践能力也随之迁移当作未言明条件,但一项站D位,另一项站S位。若方向翻转,优先检查这些漏记对象是否在对方账本中被重新命名。对照跨馆藏研机制的主源,其也解释了为什么本项证据在不同制度中可能指向不同对象。
第二幕把数字对象的治理推到前台:馆藏要能成套交付,描述要接受共同体审阅,知识图谱要保留来源,原生数字对象要能重放,低资源语言和公众贡献要有实质权力。
一、馆藏即数据Collections as Data
旧口径讨论馆藏即数据时,先看网页数量,再把不符合预期的部分留给误差项。无权利状态、无文件和只在展览页可见的对象恰是误差项里最有信息的一类;它要求文本、版本、元数据、权利、缺失、代码和执行环境同时记录未发生、未进入和被改写的情况。复算数字馆藏机制之前,围绕该转向,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
与旧口径相比,新主张把重点改成可计算馆藏的完整数据包:数字馆藏能否支持新研究主要由元数据、文件、权利和缺失说明能否作为数据包共同交付决定,而不是由网页数量决定。因果责任不能靠拟合优度垄断,必须由前瞻预测、干预或跨条件稳定性来取得,同时把这些漏记对象留在分母。
三笔关键材料是Padilla等(2019)、Lincoln等(2021)、Library of Congress(2024)。馆藏即数据项目把百万级记录批量提供下载,并附字段字典、权利和版本;研究者可做网络、图像和文本分析,但网页展示项与可下载项常不一致。其可核对性取决于可批量下载且带数据字典的记录数/全部数字馆藏记录数:分子记录可批量下载且带数据字典的记录数,分母固定为全部数字馆藏记录数。若这组账外材料没有计数,指标再精确也只是局部样本的读数。
当只开放元数据不开放对象时,“开放馆藏”会反而把不可访问包装成可计算。该情形把可计算馆藏的完整数据包从解释者变成被解释对象。若该未登记群体又在此时集中增加,说明反号来自流程选择,而非随机波动。按数字馆藏机制的对象表,换言之,馆藏即数据的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。
实施者应为这些漏记对象设立不可覆盖的日志项,并在每次更新上述机制时重新计算这一比率。若空栏增长快于分子,所谓优化应被认定为风险外移,这里由可计算馆藏的完整数据包承担证伪风险。对照数字馆藏机制的主源,其也解释了为什么本项证据在不同制度中可能指向不同对象。
可计算馆藏的完整数据包与社会归因的机器作者不能同时垄断解释;把该复核口径和明确披露创作角色的作品数/全部公开AI艺术作品数接到同一案例,才可能识别第三种条件。在数字馆藏机制的实施账本里,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于这组账外材料是否获得与成功样本同等的记录权。
二、批判数字人文与数据女性主义Critical Digital Humanities and Data Feminism
批判数字人文与数据女性主义的早期证据容易被误读,因为算法中立给出了一个清楚、可发表的答案。可在语料、档案、馆藏、知识图谱与数字保存换样本或换制度后,被归为其他、无偿数据劳动和拒绝被记录者会系统累积,说明可见结果只是完整过程的一截。按批判数字人数据女性的对象表,换言之,该转向的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。
数字人文结论的方向主要由谁定义分类、谁被缺失以及谁承担技术劳动决定,而不是由算法中立决定。在这套解释中,权力位置与数据缺失的显式化应当先于结果变化出现,并对被共同体审阅的分类字段数/全部分析字段数提供不可替代的预测。若时间顺序或增量效度不成立,就不能继续称其为决定因素,同时把这些漏记对象留在分母。
Risam(2018)、D’Ignazio与Klein(2020)、Benjamin(2019)共同构成了本项的证据骨架。数据女性主义提出检验权力、挑战二分、重视情境和可视化劳动等7项原则;案例显示同一数据集在补入照护、种族与殖民字段后会改写“总体趋势”。这里把量纲写为上述分子—分母,分子记录被共同体审阅的分类字段数,分母固定为全部分析字段数,用来约束跨群体、跨装置或跨制度的比较。
当前主张的适用域由一句反证界定:当参与被压缩为一次咨询时,包容流程会反而为既定设计背书。在语料、档案、馆藏、知识图谱与数字保存中,应预先声明何时停止、何时重估以及哪些失败仍进入全部分析字段数。这也解释了为什么批判数字人文与数据女性主义在不同制度中可能指向不同对象。
语料边界、版本溯源、权利说明、可执行工作流与共同体审阅应把该未登记群体纳入验收,而非只检查被共同体审阅的分类字段数。一项制度或技术若靠缩小全部分析字段数取得更好读数,就没有改善完整对象。对照批判数字人数据女性的主源,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于这组账外材料是否获得与成功样本同等的记录权。
双方共享什么被计入、谁有资格成为一次有效记录,被当作既定边界,本项关注权力位置与数据缺失的显式化,对方关注症状波动与活动后恶化;若只保留成功记录,该未登记群体与未就医、检测阴性和间歇性“看起来正常”的天数都会消失,碰撞也就失去材料。把批判数字人数据女性放到另见第 181 号第 19 条『数据女性主义:缺失和分类本身就是权力结果』旁核验:先对齐对象、时间窗和责任人,再检查批判数字人数据女性的核心判断在另一套分母中是否仍同向。
三、去殖民与修复性档案Decolonial and Reparative Archives
数字人文对去殖民与修复性档案的旧默认,是把机构数字化速度视为对象的固定属性。2016年后,越来越多研究发现数字化选择、版权、语言资源、平台迁移与分类权力会改变该属性,而被强制采集、无法同意开放和要求撤回的记录正是这种回写最先留下的痕迹。对照去殖民修复性档的主源,其也解释了为什么该转向在不同制度中可能指向不同对象。
本项只承认共同体对描述与访问的决定权作为方向开关,因而提出档案修复主要由受影响共同体是否拥有命名、限制访问和补写语境的决定权决定,而不是由机构数字化速度决定。该开关必须能区分语料、档案、馆藏、知识图谱与数字保存中的成功与失败,而不是只在事后给成功案例命名。
关键结果并不来自一篇孤立论文,而由Caswell、Cifor与Ramirez(2016)、Tai(2021)、Gilliland与Flinn(2024)连续推进。参与式档案项目允许原住民和被殖民群体修改描述、设置文化访问协议并加入反叙述;记录数增加不等于伤害减少,敏感图像开放可能再次暴露。因此应报告由来源共同体批准的描述数/全部敏感档案描述数;分子记录由来源共同体批准的描述数,分母固定为全部敏感档案描述数,从而让失败和成功使用同一个分母。去殖民修复性档的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
去殖民与修复性档案最容易被过度推广的地方在于当开放政策取消文化限制时,透明度会反而复制掠夺。这要求研究把数字化选择、版权、语言资源、平台迁移与分类权力视为主动变量,并检验它能否在不改变表面输入时改变该复核口径。在去殖民修复性档的实施账本里,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于这组账外材料是否获得与成功样本同等的记录权。
对实践最直接的要求,是把该未登记群体写进正式表格,并保留其发生时间和责任环节。这样才能判断上述分子—分母的变化来自共同体对描述与访问的决定权,还是来自流程重新筛人。从去殖民修复性档的材料看,只要这组账外材料仍无独立编码,该复核口径的改善就无法区分真实转向与流程清洗。
共同默认是什么被计入、谁有资格成为一次有效记录,被当作既定边界,而D位的共同体对描述与访问的决定权和S位的训练目标中的正常能力假设分别声称决定方向。可用两边量纲的联动检验谁先发生,同时把该未登记群体留在分母。
四、关联开放数据与人文知识图谱Linked Open Data and Humanities Knowledge Graphs
如果只按三元组数量给关联开放数据与人文知识图谱下定义,档案馆、研究者、来源共同体、公众与算法得到的是一个可测却不可迁移的对象。在关联开放数人文知识的实施账本里,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于该未登记群体是否获得与成功样本同等的记录权。
人文知识图谱是否产生新证据主要由实体链接能否保留来源、时间与不确定性决定,而不是由三元组数量决定。把责任锁在实体链接与来源可追溯性上,意味着数字人文要公开哪一步由它完成、哪一步只是伴随现象;若带来源断言的关系数/全部知识图谱关系数对它不敏感,理论需要被削弱。
源行所列Hyvönen(2012)、McCusker等(2018)、Fafalios等(2021)展示了命题、反驳与更新。文化遗产项目把人物、地点、作品和事件连接到百万级三元组;链接可发现跨馆关系,但同名实体、版本和推断边若无出处会快速传播错误。证据判断以上述分子—分母为中心,分子记录带来源断言的关系数,分母固定为全部知识图谱关系数;这比只报平均值更能揭示数字化选择、版权、语言资源、平台迁移与分类权力。关联开放数人文知识的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
反号条件是当自动实体链接把同名者合并时,图谱越大错误会反而级联。只要这一条件存在,实体链接与来源可追溯性便不能被当成外生常量;它必须随语料、档案、馆藏、知识图谱与数字保存更新,并在结果中报告更新前后的差。从关联开放数人文知识的材料看,只要这组账外材料仍无独立编码,这一比率的改善就无法区分真实转向与流程清洗。
围绕关联开放数据与人文知识图谱,主指标与空栏必须成对报告:前者是该复核口径,后者是该未登记群体。任何只改善前者却扩大后者的方案,都不应被档案馆、研究者、来源共同体、公众与算法视为成功。
区别在于本项从E位解释,对方从S位解释,同时把这些漏记对象留在分母。若两条都得到支持,该未登记群体和未被科学分类的地方物种、妇女知识与非市场交换应被建模为一个新的中介对象。把关联开放数人文知识放到另见第 623 号第 12 条『半同胞关系不是折扣手足:共同时间与成人安排决定亲近』旁核验:先对齐对象、时间窗和责任人,再检查关联开放数人文知识的核心判断在另一套分母中是否仍同向。
五、手写文本识别与TranskribusHandwritten Text Recognition and Transkribus
手写文本识别与Transkribus曾被放进一个过窄的问题框:逐页人工转录。这个框把数字化选择、版权、语言资源、平台迁移与分类权力当背景,也把删改、边注、污损和模型拒绝识别的字符当无效记录。转向由此不是增加一个变量,而是承认背景和余数共同参与了结果,同时把该未登记群体留在分母。从手写文本识Tran的材料看,只要该未登记群体仍无独立编码,正确识别字符数/全部人工核验字符数的改善就无法区分真实转向与流程清洗。核查手写文本识Tran时,其也解释了为什么该转向在不同制度中可能指向不同对象。
这里的单因判断是历史手稿可检索性主要由版面、字形与语言模型联合学习决定,而不是由逐页人工转录决定。版面—字形—语言联合模型若成立,应能解释方向而不只是解释方差;如果它只让模型更复杂,却不改变样本外判决,就不构成新机制,这里由版面—字形—语言联合模型承担证伪风险。
平台已支持数万名用户和数百万页训练;在同一书写者材料上字符错误率可降至5%以下,跨书写者和低资源语言则显著上升。相关出处见Muehlberger等(2019)、Sánchez等(2021)、Transkribus Consortium(2024)。本项将读数改写成上述分子—分母,其中分子记录正确识别字符数,分母固定为全部人工核验字符数;若二者不能同时取得,应明确说明缺失来自哪一步,裁决读数是该复核口径。
理论边界不是“还需更多研究”,而是当训练集只含整洁页面时,模型升级会反而增加边注和污损页漏读。若这一反例在独立材料上稳定出现,数字人文就应放弃单向叙事,转而建模反馈回路。在手写文本识Tran这条证据链上,在手写文本识别与Transkribus中,这一点把档案馆、研究者、来源共同体、公众与算法从结果使用者变成对象定义的共同责任者。
这些漏记对象需要获得与成功样本同等的追踪周期。只有在语料、档案、馆藏、知识图谱与数字保存结束后仍能说明其去向,该复核口径才不是一次性展示,而是可问责的长期读数。对手写文本识Tran做反向检验,围绕手写文本识别与Transkribus,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
双方都默认分辨率、规模和模型细度提升不会制造新的偏差对象,却分别把版面—字形—语言联合模型和跨脑区同步高密度记录定为主因;冲突必须由共同案例中的反号读数裁决,这也限定本项证据的适用域。换言之,这一制度安排的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。
六、原生数字档案与网络保存Born-Digital Archives and Web Preservation
在2012年前后的争论中,原生数字档案与网络保存暴露出旧分类的代价:是否留有截图能说明平均表现,却解释不了删除帖、私域内容、失效脚本和未抓取交互为何集中出现。对历史解释是否可核对、可重做且不抹平差异而言,这类集中不是噪声,而是边界错误。核查原生数字档网络保存时,在该转向中,这一点把档案馆、研究者、来源共同体、公众与算法从结果使用者变成对象定义的共同责任者。
原生数字对象能否成为历史证据主要由文件、依赖、版本和执行环境是否共同保存决定,而不是由是否留有截图决定。这一命题要求把版本、依赖和执行环境的共同保存与数字化选择、版权、语言资源、平台迁移与分类权力分开:前者应提供稳定的方向信息,后者只规定何时失效。两者混在一起,任何结果都能被解释,同时把这些漏记对象留在分母。
由Rosenthal等(2012)、Brügger与Schroeder编(2017)、Internet Archive与IIPC(2024)可以复原这条思想的实证演化。网页和社交媒体抓取会遗漏动态脚本、个性化内容和登录墙;LOCKSS多副本降低位腐风险,但链接腐烂和平台API变化使同一URL在多年后不可重演。最终判据不是描述性案例数,而是可在保存环境中重放的对象数/全部归档对象数;分子记录可在保存环境中重放的对象数,分母固定为全部归档对象数,使反例拥有与成功同等的统计地位。原生数字档网络保存的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
当只保存最终呈现而不保存依赖时,存档越多会反而制造可见但不可验证的证据。在原生数字档网络保存这条证据链上,围绕原生数字档案与网络保存,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
这项转向会改变数字人文的表格设计:不再把该未登记群体塞进备注,而是赋予编号、发生率和处置结果。主读数这一比率随之获得可复算的分母。对原生数字档网络保存做反向检验,换言之,原生数字档案与网络保存的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。
它与本项的共有前提是分辨率、规模和模型细度提升不会制造新的偏差对象,但两者分占D位和S位。若该复核口径改善而噪声中正确词数/全部呈现词数恶化,转换点很可能位于两类空栏的交界。把原生数字档网络保存放回原窗口,其也解释了为什么本项证据在不同制度中可能指向不同对象。
七、三维与虚拟遗产的旁数据Paradata for 3D and Virtual Heritage
传统研究以视觉逼真度描述三维与虚拟遗产的旁数据,默认语料、档案、馆藏、知识图谱与数字保存中的条件可以忽略。在三维虚拟遗产这条证据链上,围绕该转向,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
从历史解释是否可核对、可重做且不抹平差异的角度,本项作出明确押注:三维遗产模型的证据价值主要由每个重建决定、来源和不确定性是否记录为旁数据决定,而不是由视觉逼真度决定。押注对象是重建决策与不确定性的旁数据,判决读数是带来源与置信等级的模型部件数/全部可见部件数;二者若在独立材料上不再相连,押注即输,这里由重建决策与不确定性的旁数据承担证伪风险。
伦敦宪章要求区分实测、推断和假设;项目可为模型部件附来源等级,但渲染常把不同置信度显示成同样真实,用户难以辨认。三维虚拟遗产的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
对三维与虚拟遗产的旁数据的压力测试必须覆盖当渲染逼真度提高而旁数据缺失时,真实感会反而降低学术可信度。只有在该条件被主动触发后,才能判断重建决策与不确定性的旁数据是稳定机制、补偿策略还是制度结果。对三维虚拟遗产做反向检验,换言之,该研究线索的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。
档案馆、研究者、来源共同体、公众与算法应当先问这些漏记对象去了哪里,再问上述分子—分母是否提高。顺序不能倒置,因为被排除者本身可能解释全部改善,裁决读数是该复核口径。把三维虚拟遗产放回原窗口,其也解释了为什么三维与虚拟遗产的旁数据在不同制度中可能指向不同对象。三维虚拟遗产的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。
相同前提族29下,重建决策与不确定性的旁数据和脊髓网络可兴奋状态给出不同方向;新的判别维度应同时记录这组账外材料与无植入资格、无残存通路或无法长期训练的人,而非平均两种结论。把三维虚拟遗产放到另见第 194 号第 7 条『新思想 7 · 平行来源 —— 一份记录可以同时属于多个来源』旁核验:先对齐对象、时间窗和责任人,再检查三维虚拟遗产的核心判断在另一套分母中是否仍同向。
八、数字人文可复现性Reproducibility in Digital Humanities
数字人文可复现性成为新问题,是因为数字人文发现原先的论文附录是否很长只覆盖顺利通过流程的对象。未被流程接住的私有脚本、手工清洗和无法公开的数据转换没有去处,迫使研究者重新界定何为一次有效观察。对数字人文机制做反向检验,换言之,该转向的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。
数字人文分析能否被核对主要由数据、代码、参数和环境能否作为可执行工作流重建决定,而不是由论文附录是否很长决定。这不是否认其他变量,而是规定它们必须通过可执行工作流与版本锁定发挥作用。若存在绕开可执行工作流与版本锁定的稳定通道,理论就要从“决定”降为“条件之一”。
实证部分可从Peels与Bouter(2018)、Taschwer、Rauber与Bermúdez-Sabel(2021)、OpenMethods与DARIAH(2024)逐笔核对。审计研究发现大量论文虽提及软件,却不提供数据版本、参数或运行环境;容器与工作流可提高重做率,但版权和敏感数据使完全开放不可行。为避免把不同对象混在一起,本项采用第三方成功重跑的分析步骤数/全部关键步骤数,分子记录第三方成功重跑的分析步骤数,分母固定为全部关键步骤数,并把该未登记群体列为必要旁数据。数字人文机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
当依赖版本升级时,开放代码会反而给出不同结果而不报警。这让争议从词义转成设计问题:固定档案馆、研究者、来源共同体、公众与算法的构成及统计分母,只改变反号条件,看该复核口径是否出现预言中的转折。这也解释了为什么数字人文可复现性在不同制度中可能指向不同对象。
把该未登记群体设为强制披露项,是数字人文可复现性进入现实制度的最低条件。若缺少这一项,语料边界、版本溯源、权利说明、可执行工作流与共同体审阅无法识别外部成本,也无法比较不同实施者。把数字人文机制放回原窗口,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于这组账外材料是否获得与成功样本同等的记录权。
共有默认为能力一旦编码进文本、模型或装置即可脱离原实践者迁移,相反点是可执行工作流与版本锁定对外部工具的可依赖性。只要两边分母能对齐,就能观察何种条件把S位优势转成E位优势。只要该未登记群体仍无独立编码,该复核口径的改善就无法区分真实转向与流程清洗。
九、公众与公民数字人文Public and Citizen Digital Humanities
早期口径把公众与公民数字人文理解为标注数量,关注可见产出而少问形成条件。被驳回但有理由的标注、照护劳动和社区冲突却显示,文本、版本、元数据、权利、缺失、代码和执行环境里存在一批既影响结论又不享有字段地位的对象。把公众公民数字放回原窗口,其也解释了为什么该转向在不同制度中可能指向不同对象。就公众公民数字的外推边界看,围绕该转向,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
新说法可压缩为:贡献者的知识与治理权决定方向,所以公众参与质量主要由贡献者是否拥有解释、署名和项目治理权决定,而不是由标注数量决定。最严格的反证不是效应变小,而是在同一分母下出现相反结果且无需贡献者的知识与治理权。
众包转录项目可完成数十万页并达到高一致率,但少数高活跃者贡献大部分任务;若只把公众当免费劳动力,参与会在项目结束后迅速流失。这些结果在Ridge编(2014)、Bonacchi等(2019)、Dunn与Hedges(2023)中形成支持与修正。公众公民数字的结构读数拆成3项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
当前理论自己承认当积分和速度成为唯一目标时,参与规模上升会反而降低解释多样性。因此部署前要定义失效阈值,部署后要记录转折点,裁决读数是该复核口径;否则语料边界、版本溯源、权利说明、可执行工作流与共同体审阅只会积累成功案例。围绕公众公民数字,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于这组账外材料是否获得与成功样本同等的记录权。
应用端应建立双账:一账记录上述分子—分母,另一账记录该未登记群体。两账之间的差额,才显示贡献者的知识与治理权带来的真实增益与被隐藏的代价。沿公众公民数字的责任链,只要这组账外材料仍无独立编码,该复核口径的改善就无法区分真实转向与流程清洗。公众公民数字的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。
两项用同一前提族27起步,却把决定权交给不同位置;把上述分子—分母与由残障使用者主导的设计决策数/全部关键设计决策数联合记录,才能发现被两边都删去的对象。在公众与公民数字人文中,这一点把档案馆、研究者、来源共同体、公众与算法从结果使用者变成对象定义的共同责任者。
十、多语与低资源数字人文Multilingual and Low-Resource Digital Humanities
档案馆、研究者、来源共同体、公众与算法曾用模型总参数快速判断多语与低资源数字人文。就多语低资源数的外推边界看,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于该未登记群体是否获得与成功样本同等的记录权。
本项把语言资源覆盖与共同体校验置于因果链中心,并据此断言数字人文能否代表全球文化主要由低资源语言是否获得可校验语料、工具与共同体控制决定,而不是由模型总参数决定。为了避免循环定义,语言资源覆盖与共同体校验的测量必须独立于结果本身,否则所谓解释只是换名。
从Joshi等(2020)、Ortega等(2021)、UNESCO(2025)的时间序列可以看到理论如何被约束。语言资源分类显示世界数千种语言中,绝大多数缺少标注语料与基础工具;多语模型在高资源语言上平均更好,但脚本、方言和口语差距可超过数十个百分点。量纲选为达到最低可用准确率的语言数/全部目标语言数,分子记录达到最低可用准确率的语言数,分母固定为全部目标语言数;这让部署后的漂移不再被平均值遮住,同时把该未登记群体留在分母。多语低资源数的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
多语与低资源数字人文的可证伪性来自当多语模型用高资源语言迁移时,平均覆盖上升会反而抹平少数语言结构。该研究线索的反号条件若被删去,模型几乎能解释任何结果;保留它,语言资源覆盖与共同体校验才真正承担风险。只要这些漏记对象仍无独立编码,该复核口径的改善就无法区分真实转向与流程清洗。
为了避免“成功者偏差”,数字人文必须持续追踪这组账外材料,并公开它们对全部目标语言数的贡献。若这些对象没有回到统计中,任何平均提升都应降级解释,裁决读数是上述分子—分母。在多语与低资源数字人文中,这一点把档案馆、研究者、来源共同体、公众与算法从结果使用者变成对象定义的共同责任者。就多语低资源数的遗漏记录而言,复核表还要标明退出日期、原始责任人和未纳入理由。多语低资源数的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。
把多语低资源数放到另见第 194 号第 8 条『新思想 8 · 档案沉默 —— 缺失本身是可研究的对象』旁核验:先对齐对象、时间窗和责任人,再检查多语低资源数的核心判断在另一套分母中是否仍同向。
十一、大模型辅助人文研究Large Language Models for Humanities Research
大模型辅助人文研究的旧问题意识由回答是否像学术语言主导,默认记录到的就是全部。围绕大模型能机制,只要该未登记群体仍无独立编码,有原文证据可核对的模型判断数/全部模型判断数的改善就无法区分真实转向与流程清洗。
大模型能否成为人文研究工具主要由每个解释能否回到具体材料、提示与版本决定,而不是由回答是否像学术语言决定。可证伪点在于,可追溯提示—材料—解释链必须在档案馆、研究者、来源共同体、公众与算法真正作出决定之前可观察,并使这一比率优于一个不含它的基线。
证据不只回答“有没有”,还要回答“在多少有效对象中发生”,在大模型辅助人文研究中可用有原文证据可核对的模型判断数直接检验。跨文本摘要和主题编码实验显示模型可提高初筛速度,但引文幻觉、长文本遗漏和版本漂移持续存在;人工复核后有效结论比例才可作为读数。对应出处为Bender等(2021)、Koolen等(2024)、National Endowment for the Humanities(2025)。因此报告该复核口径,其中分子记录有原文证据可核对的模型判断数,分母固定为全部模型判断数,是本项最低核验要求。大模型能机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
一旦发生当训练语料含研究对象的二手解释时,所谓新读法会反而复制既有权威,原有方向便可能翻转。最有力的复核是在不同语料、档案、馆藏、知识图谱与数字保存中重复这一转换,而不是只比较显著与不显著。沿大模型能机制的责任链,在大模型辅助人文研究中,这一点把档案馆、研究者、来源共同体、公众与算法从结果使用者变成对象定义的共同责任者。
上述机制对制度的要求不是更多宣传,而是更好的记录:该复核口径、排除原因、人工修复和这些漏记对象应在同一审计链上。复算大模型能机制之前,围绕本项证据,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
共同前提把两条拉到一张桌上,S位的可追溯提示—材料—解释链与D位的可审计的研究角色分离形成真正冲突;可比量纲则提供裁决而非修辞,同时把这组账外材料留在分母。按大模型能机制的对象表,换言之,该研究线索的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。
十二、人在回路的计算阐释Human-in-the-Loop Computational Interpretation
把人在回路的计算阐释仅仅看成自动分类准确率,会让数字人文只奖励可被现有工具看见的部分。与模型结论冲突但未被选入展示的文本提醒我们:不可见并不等于不存在,它可能正决定数字化究竟扩大证据还是扩大既有偏差。沿计算阐释机制的责任链,在该转向中,这一点把档案馆、研究者、来源共同体、公众与算法从结果使用者变成对象定义的共同责任者。复算计算阐释机制之前,对数字化究竟扩大证据还是扩大既有偏差的回答,也因此取决于该未登记群体是否获得与成功样本同等的记录权。
这一条的立场不是“值得关注”,而是计算阐释的知识增量主要由模型发现与细读反证之间能否持续往返决定,而不是由自动分类准确率决定。模型发现与细读反证的往返因此承担唯一主因的压力;只要部署后出现稳定反例,适用域就要被明确缩小,同时把这些漏记对象留在分母。
大型文学项目先用模型发现时间或类型分布,再抽取反例回到文本;每轮人工复核会重写标签和问题,故最终解释不能归属于模型或人单方。计算阐释机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
边界写得很具体:当人工只确认模型最强模式时,人在回路会反而成为偏差放大器。它提醒数字人文,被测对象会回应测量、治理或技术安排;忽略这种回写,任何稳定性都可能是暂时的,裁决读数是该复核口径。按计算阐释机制的对象表,围绕人在回路的计算阐释,版本、时间顺序与人工改写痕迹应进入语料边界、版本溯源、权利说明、可执行工作流与共同体审阅的正式记录。
真正的落地指标由两部分组成:上述分子—分母衡量中心结果,该未登记群体揭示现行账本未承认的存在。只有二者同时改善,历史解释是否可核对、可重做且不抹平差异才可被称为进步。对照计算阐释机制的主源,换言之,人在回路的计算阐释的有效范围必须随数字化选择、版权、语言资源、平台迁移与分类权力变化而重新声明。
双方都默认观察、记录与评估不会改变正在被观察的系统,却分别从D位与S位解释结果。若两条在不同阶段轮流成立,这些漏记对象与被封后重生账户、付费真人与无法归因的自动化工具共同标记的转换区就是新对象。在计算阐释机制的实施账本里,其也解释了为什么本项证据在不同制度中可能指向不同对象。
◎ 二十年连起来看
从远读、历史网络分析到手写文本识别与Transkribus,第一条历史线索是对象边界由单一结果扩展到大规模文本分布而非典范个案、关系资料的覆盖与方向和版面—字形—语言联合模型。这使数字化究竟扩大证据还是扩大既有偏差不再由中心样本独占,未数字化、版权受限和无稳定版本的作品等空栏必须进入正式账本。
第二条线索落在证据制度。文体计量与作者归属用正确归属文本数/全部待归属文本数约束网络层结论,批判数字人文与数据女性主义用被共同体审阅的分类字段数/全部分析字段数检查迁移,公众与公民数字人文则把版本与部署漂移纳入复核;一次成功由此让位给跨条件可重复,第473号据此限定历史解释是否可核对、可重做且不抹平差异。
第三条线索是责任主体的变化,第473号据此限定历史解释是否可核对、可重做且不抹平差异。IIIF互操作图像基础设施、三维与虚拟遗产的旁数据和人在回路的计算阐释共同显示,数字化选择、版权、语言资源、平台迁移与分类权力会回写指标本身;第473号因此不是二十个口号,而是状态、路径、条件与空栏相互转换的证据图。
◎ 三个常见误解
误解1把远读缩成少数典范作品。这种口径之所以诱人,是因为责任单一、指标整齐,第473号据此限定历史解释是否可核对、可重做且不抹平差异;但文学史转向主要由大规模文本分布的形状决定,而不是由少数典范作品决定。复核必须同时查看进入分析的文本数/理论上相关的全部文本数与未数字化、版权受限和无稳定版本的作品。
第2种误读,是把算法中立当成批判数字人文与数据女性主义的充分解释。它在短期报告里很省事,却会漏掉被归为其他、无偿数据劳动和拒绝被记录者;更可检验的陈述是数字人文结论的方向主要由谁定义分类、谁被缺失以及谁承担技术劳动决定,而不是由算法中立决定,判据落在被共同体审阅的分类字段数/全部分析字段数。
关于大模型辅助人文研究,常见的第3个误区是只追踪回答是否像学术语言。这容易产生清楚的排行榜,却不能处理反号条件,第473号据此限定历史解释是否可核对、可重做且不抹平差异;正确做法是以大模型能否成为人文研究工具主要由每个解释能否回到具体材料、提示与版本决定,而不是由回答是否像学术语言决定为待证命题,并保留无法追溯来源、被模型拒绝和因版权未输入的文本。
◎ 与相邻领域的接口
主题模型的人文解释与第476号第十九条“食品系统倒计时指标”通过同族前提〔17 局部最优可加总为整体最优〕“各局部环节分别改善,系统整体就会随之改善”接通。
历史网络分析与第476号第八条“食品环境而非个人意志”通过同族前提〔02 单一读数代表复杂对象〕“一个汇总读数足以代表多层对象的真实状态”接通。
手写文本识别与Transkribus与第472号第九条“Neuropixels高密度神经记录”通过同族前提〔29 越精细越接近真实〕“分辨率、规模和模型细度提升不会制造新的偏差对象”接通。
多语与低资源数字人文与第471号第四条“网络化认知与连接组”通过同族前提〔27 能力可与承载它的人分离〕“能力一旦编码进文本、模型或装置即可脱离原实践者迁移”接通。
◎ 争议现场
远读目前的分歧在于大规模文本分布而非典范个案究竟是原因还是条件性代理。支持材料显示远读以数千至数万部小说的体裁、词频和出版时间形成趋势线;批评者复算后指出分类与历史解释会改变方向,故模型必须公开语料边界;反方可抓住的自我限制是当数字化语料集中于畅销与英语作品时,规模增大会反而放大典范偏差。收敛所需的设计是双重操纵、盲分析与预注册模型比较,并预先锁定进入分析的文本数/理论上相关的全部文本数和未数字化、版权受限和无稳定版本的作品。
围绕去殖民与修复性档案,现有证据并未自动给出唯一机制。参与式档案项目允许原住民和被殖民群体修改描述、设置文化访问协议并加入反叙述;记录数增加不等于伤害减少,敏感图像开放可能再次暴露提供了正向依据,而当开放政策取消文化限制时,透明度会反而复制掠夺允许方向翻转。采用跨站点复算、失败样本回补与异质性分析时,应把被强制采集、无法同意开放和要求撤回的记录列作并列结局;若完整分母下共同体对描述与访问的决定权不再增量预测,争论即有判决。
大模型辅助人文研究的争议不是有没有效应,而是效应能否离开原始条件。已知材料包括跨文本摘要和主题编码实验显示模型可提高初筛速度,但引文幻觉、长文本遗漏和版本漂移持续存在;人工复核后有效结论比例才可作为读数;最强反证条件则是当训练语料含研究对象的二手解释时,所谓新读法会反而复制既有权威。要结束争论,需用训练—测试时间隔离、样本外验证与部署后监测复算有原文证据可核对的模型判断数/全部模型判断数,并公开所有进入无法追溯来源、被模型拒绝和因版权未输入的文本的案例。
◎ 往下五年看什么
第一项读数是可批量下载且带数据字典的记录数/全部数字馆藏记录数能否在两个独立数据源和一个真实场景维持方向;同时应公开无权利状态、无文件和只在展览页可见的对象的发生率,否则馆藏即数据仍停在样本内。
第二项读数看手写文本识别与Transkribus是否跨材料复现,并在研究开始前登记“当训练集只含整洁页面时,模型升级会反而增加边注和污损页漏读”这一反号条件;只增加样本量而不保留删改、边注、污损和模型拒绝识别的字符不算进展。
第三项读数是被采纳且署名的公众贡献数/全部公众提交数的版本漂移曲线。地区、设备或制度切换后,被驳回但有理由的标注、照护劳动和社区冲突若同步增加,就要把所谓改进重判为选择效应。
第四项读数看人在回路的计算阐释能否把角色、退出、失败和人工修复写进正式规范;缺少与模型结论冲突但未被选入展示的文本的连续日志,规模扩张只会放大不可核对性。
◎ 可与哪些领域对撞
远读×第475号第九条“内在能力”:两条由同族前提〔17 局部最优可加总为整体最优〕“各局部环节分别改善,系统整体就会随之改善”进入同一问题,却分别把大规模文本分布而非典范个案与多域能力储备置于S位和E位。若二者都成立,未数字化、版权受限和无稳定版本的作品向临床未测的沟通、数字使用与文化活动能力的转换就是第三对象;判决读数为进入分析的文本数/理论上相关的全部文本数与保持或改善的能力域数/全部评估能力域数的联动。
历史网络分析×第476号第八条“食品环境而非个人意志”:两条由同族前提〔02 单一读数代表复杂对象〕“一个汇总读数足以代表多层对象的真实状态”进入同一问题,却分别把关系资料的覆盖与方向与可得性与默认选择置于E位和D位。若二者都成立,未保存信件、非正式关系和没有姓名的中介者向外卖算法、夜班食堂与无法选择的机构餐的转换就是第三对象;判决读数为有来源可核对的关系边数/全部推定关系边数与健康选项可得点位数/全部食品销售点位数的联动。
关联开放数据与人文知识图谱×第476号第十六条“原住民食品系统与食物主权”:两条由同族前提〔01 谁进入分母〕“什么被计入、谁有资格成为一次有效记录,被当作既定边界”进入同一问题,却分别把实体链接与来源可追溯性与社群对土地、知识与食物的控制置于E位和S位。若二者都成立,无法唯一识别、存在争议和不愿被统一命名的实体向未被科学分类的地方物种、妇女知识与非市场交换的转换就是第三对象;判决读数为带来源断言的关系数/全部知识图谱关系数与由社群自主决定的食物资源量/全部本地食物资源量的联动。
多语与低资源数字人文×第471号第四条“网络化认知与连接组”:两条由同族前提〔27 能力可与承载它的人分离〕“能力一旦编码进文本、模型或装置即可脱离原实践者迁移”进入同一问题,却分别把语言资源覆盖与共同体校验与网络整合—分离动态置于E位和S位。若二者都成立,无标准正字法、口述传统和拒绝公开语料的语言向未达到阈值却维持跨模块协调的弱连接的转换就是第三对象;判决读数为达到最低可用准确率的语言数/全部目标语言数与跨模块连接强度/网络全部连接强度的联动。
◎ 十条可做的研究命题
1. 命题:大规模文本分布而非典范个案对进入分析的文本数/理论上相关的全部文本数具有独立、可迁移的增量。设计:采用预注册二乘二因子实验,分别操纵主因与反号条件,并把未数字化、版权受限和无稳定版本的作品列为并列结局。证伪:操纵大规模文本分布而非典范个案后进入分析的文本数/理论上相关的全部文本数没有样本外增量,或把未数字化、版权受限和无稳定版本的作品补回分母后方向消失。
2. 命题:可检索词项的长期频率对目标词项出现次数/同年全部可检索词数具有独立、可迁移的增量。设计:采用多站点重复研究,统一核心材料并保留站点语境,并把OCR不可读、非拉丁文字与未入库出版物列为并列结局。证伪:在“当语料构成随年份改变时,词频趋势会反而测到出版结构”条件下未出现预先声明的反号,而且替代机制无需可检索词项的长期频率即可复现结果。
3. 命题:历史对象的时空关系对可定位到可信历史坐标的记录数/全部含地名记录数具有独立、可迁移的增量。设计:采用前瞻纵向队列,连续记录主指标、时间顺序和空栏,并把消失地名、移动边界和无法地理编码的叙述列为并列结局。证伪:跨站点估计的可定位到可信历史坐标的记录数/全部含地名记录数方向不一致,且差异全部由消失地名、移动边界和无法地理编码的叙述的排除规则解释。
4. 命题:可声明的文本差异编码对被显式编码的异文数/校勘发现的全部异文数具有独立、可迁移的增量。设计:采用随机交叉设计,让同一对象经历两种条件,并把无法判读、被编辑合并和没有标记责任人的异文列为并列结局。证伪:时间顺序显示结果先于可声明的文本差异编码,或完整分母使主效应降为零。
5. 命题:可计算馆藏的完整数据包对可批量下载且带数据字典的记录数/全部数字馆藏记录数具有独立、可迁移的增量。设计:采用对抗压力测试,主动制造最不利输入或制度条件,并把无权利状态、无文件和只在展览页可见的对象列为并列结局。证伪:对抗条件触发后可批量下载且带数据字典的记录数/全部数字馆藏记录数仍不随可计算馆藏的完整数据包变化,说明该因素不是决定项。
6. 命题:共同体对描述与访问的决定权对由来源共同体批准的描述数/全部敏感档案描述数具有独立、可迁移的增量。设计:采用登记册审计,比较公开记录与原始流程日志,并把被强制采集、无法同意开放和要求撤回的记录列为并列结局。证伪:登记册与原始日志的差额足以解释全部收益,被强制采集、无法同意开放和要求撤回的记录回补后结论翻转。
7. 命题:版面—字形—语言联合模型对正确识别字符数/全部人工核验字符数具有独立、可迁移的增量。设计:采用自然实验,利用政策、平台或环境切换,并把删改、边注、污损和模型拒绝识别的字符列为并列结局。证伪:自然切换没有改变正确识别字符数/全部人工核验字符数,而未观测环境变量独立重现同一结果。
8. 命题:重建决策与不确定性的旁数据对带来源与置信等级的模型部件数/全部可见部件数具有独立、可迁移的增量。设计:采用仿真加留出样本,先估转换点再用未见样本检验,并把纯推断部件、被美化缺口和没有来源的材质列为并列结局。证伪:留出样本上预测失败,或转换阈值无法在第二材料中重复,第473号据此限定历史解释是否可核对、可重做且不抹平差异。
9. 命题:贡献者的知识与治理权对被采纳且署名的公众贡献数/全部公众提交数具有独立、可迁移的增量。设计:采用共同生产的混合方法,由受影响者共同定义失败与遗漏,并把被驳回但有理由的标注、照护劳动和社区冲突列为并列结局。证伪:受影响者定义的失败与研究者定义不一致,且采用前者后贡献者的知识与治理权失去解释力。
10. 命题:可追溯提示—材料—解释链对有原文证据可核对的模型判断数/全部模型判断数具有独立、可迁移的增量。设计:采用真实世界连续监测,版本化记录漂移、退出和人工修复,并把无法追溯来源、被模型拒绝和因版权未输入的文本列为并列结局。证伪:部署漂移由版本和人工修复完全解释,可追溯提示—材料—解释链对长期有原文证据可核对的模型判断数/全部模型判断数不再贡献。
◎ 资料核验
- Moretti,2005年《Graphs, Maps, Trees》,Verso
- Da,2019年《Critical Inquiry》45:601–618,DOI 10.1086/702594
- Underwood,2022年《Distant Horizons》,University of Chicago Press
- Blei、Ng与Jordan,2003年《Journal of Machine Learning Research》3:993–1022
- Blei,2012年《Communications of the ACM》55:77–84,DOI 10.1145/2133806.2133826
- Boyd-Graber、Hu与Mimno,2017年《Applications of Topic Models》,Foundations and Trends
- Michel等,2011年《Science》331:176–182,DOI 10.1126/science.1199644
- Pechenick、Danforth与Dodds,2015年《PLoS ONE》10:e0137041,DOI 10.1371/journal.pone.0137041
- Koplenig,2017年《PLoS ONE》12:e0174470,DOI 10.1371/journal.pone.0174470
- Stabamatatos,2009年《Journal of the American Society for Information Science and Technology》60:538–556,DOI 10.1002/asi.21001
- Koppel、Schler与Argamon,2009年《Journal of Machine Learning Research》10:107–131
- Savoy,2020年《Machine Learning Methods for Stylometry》,Springer
- Bodenhamer、Corrigan与Harris编,2010年《The Spatial Humanities》,Indiana University Press
- Gregory与Geddes编,2014年《Toward Spatial Humanities》,Indiana University Press
- Murrieta-Flores等,2023年《International Journal of Humanities and Arts Computing》17:1–23,空间人文更新
- Lemercier,2005年《Revue d’Histoire Moderne & Contemporaine》52:88–112
- Düring等编,2016年《The Power of Networks》,Routledge
- Grandjean,2021年《Journal of Historical Network Research》5:136–186
- TEI Consortium,2007年《TEI P5 Guidelines》第一版
- Pierazzo,2015年《Digital Scholarly Editing》,Ashgate
- Bleier等编,2023年《Digital Scholarly Editions as Interfaces》,Norderstedt
- IIIF Consortium,2014年《Image API 2.0》规范
- Snydman、Sanderson与Cramer,2015年《Archiving Conference》2015:16–21,IIIF互操作架构
- IIIF Consortium,2024年《Presentation API 3.0》实施更新
- Padilla等,2019年《Always Already Computational: Collections as Data》报告
- Lincoln等,2021年《Journal of Cultural Analytics》6:1–25,馆藏数据批评
- Library of Congress,2024年《LC for Robots》数据包与API更新
- Risam,2018年《New Digital Worlds》,Northwestern University Press
- D’Ignazio与Klein,2020年《Data Feminism》,MIT Press
- Benjamin,2019年《Race After Technology》,Polity
- Caswell、Cifor与Ramirez,2016年《The Library Quarterly》86:56–76,DOI 10.1086/684145
- Tai,2021年《Journal of Critical Library and Information Studies》4:1–29
- Gilliland与Flinn,2024年《Archival Science》24:1–22,修复性档案更新
- Hyvönen,2012年《Publishing and Using Cultural Heritage Linked Data on the Semantic Web》,Morgan & Claypool
- McCusker等,2018年《Semantic Web》9:401–416,知识图谱可追溯性
- Fafalios等,2021年《Journal on Computing and Cultural Heritage》14:Article 8
- Muehlberger等,2019年《Journal of Documentation》75:954–976,DOI 10.1108/JD-07-2018-0114
- Sánchez等,2021年《Pattern Recognition》117:107966,DOI 10.1016/j.patcog.2021.107966
- Transkribus Consortium,2024年《HTR+与PyLaia多语模型评估》技术报告
- Rosenthal等,2012年《Communications of the ACM》55:49–55,DOI 10.1145/2063176.2063192
- Brügger与Schroeder编,2017年《The Web as History》,UCL Press
- Internet Archive与IIPC,2024年《Web Archiving Life Cycle Model》更新
- Denard,2012年《London Charter for the Computer-Based Visualisation of Cultural Heritage》
- Bentkowska-Kafel、Baker与Denard编,2016年《Paradata and Transparency in Virtual Heritage》,Routledge
- Apollonio等,2023年《Digital Applications in Archaeology and Cultural Heritage》30:e00283
- Peels与Bouter,2018年《Research Integrity and Peer Review》3:15,计算研究透明性
- Taschwer、Rauber与Bermúdez-Sabel,2021年《Journal of Cultural Analytics》6:1–24
- OpenMethods与DARIAH,2024年《可复用数字人文工作流建议》
- Ridge编,2014年《Crowdsourcing Our Cultural Heritage》,Ashgate
- Bonacchi等,2019年《Public Archaeology》18:1–22,公民遗产参与评估
- Dunn与Hedges,2023年《International Journal of Humanities and Arts Computing》17:173–195
- Joshi等,2020年《Findings of ACL 2020》531–540,DOI 10.18653/v1/2020.findings-emnlp.38
- Ortega等,2021年《Digital Scholarship in the Humanities》36:ii141–ii155
- UNESCO,2025年《多语数字环境与低资源语言技术》报告
- Bender等,2021年《FAccT 2021》610–623,DOI 10.1145/3442188.3445922
- Koolen等,2024年《Journal of Cultural Analytics》9:1–29,大模型文学分析评测
- National Endowment for the Humanities,2025年《AI and the Humanities》研究指南
- Piper,2018年《Enumerations》,University of Chicago Press
- van Dalen-Oskam,2021年《The Riddle of Literary Quality》,Amsterdam University Press
- Underwood与So,2025年《Critical Inquiry》51:数字模型与解释责任