“可靠”不能只看两次结果是否相似
有研究生把同一份逐字稿交给工具两次,看到标签大致相同,就认为结果可靠。也有人因为某个标签与自己的直觉不符,便断定 AI 完全不能用。两种判断都把复杂的方法问题压缩成了一个表面现象。质性研究关心的不只是重复得到什么,还要问证据是否可追溯、解释是否符合研究设计、分歧有没有被如实记录。
可靠性也不是一个脱离情境的百分比。材料类型、研究问题、编码层级和评价标准都会改变结果的含义。对于探索性研究,候选编码的覆盖和可讨论性可能比一次性一致更重要。对于团队项目,定义是否让不同研究者作出相近判断又是另一项要求。
导师在审阅初稿时,常会追问一句:“这条结论是从哪一段话来的?”如果研究者只能展示 AI 生成的摘要,无法指出原文、切片理由和修改记录,结果即使读起来顺畅,也很难通过方法审查。可靠性取决于证据链是否完整,标签看起来是否整齐只是后一个问题。
AI 最容易在哪些地方误读材料
长文本被切成孤立句子后,否定、反讽和时间转折很容易消失。受访者说“我当然不敢再问了”,可能是在讽刺,也可能是在认真描述权力关系。如果只看这一句,任何自动标签都需要谨慎核对。沉默、停顿和说话人之间的互动同样依赖现场语境,不能因为模型给出了流畅的解释就当成事实。
偏差还可能来自材料本身和研究者的提问方式。某类参与者的表达更长、更符合书面语,工具可能因此更容易捕捉他们的概念。研究者预先写入提示的理论词汇,也会把注意力引向某些范畴。复核时既要检查 AI 漏掉了什么,也要检查它是否把你原本的假设重复了一遍。
跨案例比较能暴露这类偏差:若工具对正式、完整的叙述给出细致编码,却把方言、停顿或简短回答归为“缺乏信息”,研究者就需要回到材料,确认是表达方式不同,还是确实没有相关经验。把不同语言风格和不同立场的片段放在同一轮抽样中,往往比只检查“最典型”的案例更能发现问题。
建立一套能被别人复核的检查方式
可以从少量材料建立人工基准:选取能体现差异的片段,自己完成切片和初始编码,再与 AI 草稿逐条比较。比较时不要只记录“正确”或“错误”,还要写清是语境遗漏、概念过宽、范畴关系不成立,还是原文位置无法确认。这样的记录会逐渐形成项目自己的编码定义和复核规则。
正式处理时,随机抽样、边界案例和反例都应进入复核范围。若团队成员对同一片段意见不同,先回到定义和上下文,不要用投票掩盖分歧。有些分歧说明范畴需要拆开,有些则提示研究问题本身还不够清楚。复核结果应保留在备忘录或版本记录中,方便论文写作时说明人工参与。
抽样比例不必机械套用一个数字:材料较少时可以逐条检查,材料很多时先保证每类参与者、每个关键场景和每个主题都有证据,再增加随机片段。研究者应把“为什么抽这些”写下来,别人才能判断复核是否覆盖了真正可能出错的地方。
比如,一个项目里大多数受访者都用书面语,只有两人使用方言或夹杂专业缩写,这两人的片段就不应因为数量少而被排除在复核之外。边界材料往往暴露编码定义最薄弱的地方,也能提醒研究者不要把“常见表达”误当成唯一表达。抽样计划可以随项目进展修改,但每次修改都应留下日期和理由。
把不确定性写进研究记录
研究者不需要把 AI 描述成“完全客观”或“完全无用”。在方法部分说明使用了哪一类文本材料、AI 负责提出什么草稿、人工如何抽样和修改,读者就能判断结论的边界。对于无法判断的片段,可以标为待讨论,而不是强行归入现成主题。保留不确定性并不会削弱研究,反而让论证更诚实。
当主题与原文证据不一致时,优先修改解释而不是修改材料。少量但关键的反例可能迫使你缩小命题,或者增加一个条件。这类变化应在版本中留下痕迹。关于访谈材料的具体复核场景,可结合访谈逐字稿如何编码一起阅读。
在论文中报告 AI 使用,也不需要把每一次点击都写成操作日志。交代材料范围、工具承担的任务、人工复核的方式,以及哪些判断明确由研究者完成,通常已经能让读者理解研究边界。若某些片段无法可靠分类,可以说明它们被保留为未决材料,而不是假装所有数据都得到了同样确定的答案。
方法章节还可以交代一次具体的修订,例如工具把“我不敢再问”标成“缺乏主动性”,研究者回看上下文后发现那是对公开批评的回应,于是改为“在评价风险下回避追问”,并把这条边界加入定义。一个小例子足以让读者看到复核不是形式上的勾选,而是会改变解释的研究判断。
灵析能做什么、不能代替什么
灵析支持上传访谈逐字稿、访谈记录和田野笔记等文本材料,生成开放编码、主轴编码和选择编码草稿,并保留每条编码对应的原文位置。这些结果适合做候选整理和讨论起点,研究者仍需核对切片、语境、范畴关系与反例,完成自己的理论解释。
灵析当前不支持音频或视频直接上传、转写或分析,也不把 AI 草稿当成学术结论。复核完成后可以导出 .qdpx 衔接 NVivo。关于 AI 辅助研究的取舍,也可以参考NVivo 和 AI 质性分析工具怎么选。
常见问题
AI 编码准确率达到多少才算可靠?
不能用一个脱离研究情境的百分比定义可靠性。材料类型、研究问题、编码层级和评价标准都会改变结果,更重要的是证据可追溯、复核过程透明、解释与材料一致。
让两次 AI 分析结果一致,是否就证明可靠?
不证明,重复得到同一错误也可能发生,应结合研究者基准、反例、跨案例比较和审计记录判断。
可以把 AI 生成内容直接当作论文结果吗?
不应直接照搬,应先逐条核对原文并由研究者重新解释,在方法部分如实说明 AI 的辅助范围。