约 3–5 分钟 · 无需专业知识 · 没有标准答案
我们想请你阅读一则网络新闻,然后回答几个关于这则新闻的问题。请像平时刷手机看新闻一样自然阅读,凭第一感觉回答即可。
上方矩阵切换 6 个条件,下方实时呈现该条件对应的新闻页面。「高亮改动位置」会把一致/冲突两版真正不同的那一句标黄——本轮改写后,两版差异已压缩到证据二的后半句与折叠区的一个数值。
| 问题 | 改前 | 改后 |
|---|---|---|
| 要读懂 p 值 | 正文证据一、证据二各出现一次 p = .012 p = .03 p = .41,还要理解"达到统计显著水平 / 未达统计显著水平" |
正文完全不出现统计术语(脚本实测:p 值出现 0 次)。数字与统计检验结果统一收进正文下方的折叠区「查看详细数据」,默认收起 |
| 要读懂专业指标 | "泪膜破裂时间",并用"该指标越长,说明眼表越湿润稳定"解释 | 正文只写「另一项与眼睛状态有关的指标」,不出现任何指标名称;指标名"眼表状态指标"仅出现在折叠区 |
| 直接告诉被试"有冲突" | 证据二标题「客观生理指标:未见显著变化」直接与一致版标题形成对比;正文结尾写「与主观评分的变化方向不一致」;证据三标题「尚不能确定改善来源」 | 两版证据二标题完全相同(同为「另一项观察指标」);正文不出现"不一致 / 冲突 / 矛盾 / 无法证明"等判断词,只描述两项结果各自的变化程度 |
| 依赖专家 | 证据三是「某三甲医院眼科医师访谈」,直接裁决哪条证据更重要(一致版"两项互相印证"、冲突版"因此尚不能确定") | 证据三改为研究背景信息(参与者来源、测试周期、后续计划),不含任何判断。正文中的专家判断出现 0 次(脚本实测) |
| 证据三替被试做比较 | 证据三同时评述证据一与证据二的关系,实际替代了操作检验 MC2 的功能 | 证据三不再涉及前两项证据;不使用「因此 / 说明 / 意味着」等总结性连接 |
| 像"真假题" | "主观明显改善 vs 客观完全未改善"+ 裁判式专家结论,整体读起来接近"一项说有效、另一项验证失败" | 改为「部分支持 vs 结果没有完全对上」:冲突版是"这项指标只有很小的变化、与对照组差别不大",不是"完全无效" |
字数、证据数、来源数、语言强度等配平结果见「④ 实验纯净度审计」下方的自动核对表。
| 标准 | A. 科技/AI 国产折叠屏铰链耐用性实测 | B. 健康/生活 手机"护眼模式"对视疲劳的作用 | C. 社会/消费 共享单车对短途通勤效率的影响 |
|---|---|---|---|
| 1 普通大学生能理解 | 通过 | 通过 | 通过 |
| 2 不需要专业知识 | 偏弱 需要理解"铰链疲劳寿命""开合次数" | 通过 只需理解"用眼后眼睛累不累" | 通过 |
| 3 不涉及敏感政治议题 | 通过 | 通过 | 偏弱 易触及城市治理争议 |
| 4 不依赖强个人立场 | 通过 | 通过 护眼属功能性判断,非身份性议题 | 偏弱 有车/无车群体会分化 |
| 5 有真实性判断空间 | 通过 | 通过 学界本身结论不一,判断空间大 | 偏弱 结论较易被直觉判断 |
| 6 可自然放入 3 组独立证据 | 通过 | 通过 学生自我感受 / 另一项观察指标 / 研究背景信息(本轮已去掉专家解读,避免权威替被试做判断) | 通过 |
| 7 可制造一致与冲突 | 通过 | 通过 「主观感受 vs 另一项观察指标」的分歧是真实、常见、且不需要统计知识就能读懂的分歧类型 | 通过 |
| 8 冲突不会一眼看出"写错了" | 偏弱 数据打架容易被看成造假 | 通过 冲突是"这项指标变化很小",不是"完全无效",属科研常态 | 通过 |
| 9 可设计真实验证任务 | 通过 | 通过 原始数据 / 机构说明 / 独立报道 / 事实核查天然齐备 | 通过 |
| 10 不靠改变来源质量制造冲突 | 通过 | 通过 两个条件引用完全相同的来源名,只改数据 | 通过 |
| 结论:选 B. 健康/生活 ——「手机护眼模式对视疲劳的作用」。理由是它唯一在全部 10 条上通过,且其"主观量表 vs 客观生理指标"的分歧是科研中真实存在、普通人能理解、且不需要贬低任何一方来源的冲突类型。 | |||
A 被排除的核心原因:科技硬件实测的冲突容易读成"参数造假",且需要一定产品知识;C 被排除的核心原因:涉及群际立场与治理争议,会引入未控制的个人相关性差异。
按真实被试流程走一遍:阅读 → 操作检验 → 核验机会 → 最终判断。所有作答实时写入「③ 数据」。
右侧为当前记录;下方为累计的多被试记录表(Demo 版存在浏览器内存中,刷新即清空)。
十四项检查。判定基于当前已制作的材料;凡不能靠材料本身解决、需要预测试或正式实验验证的,均明确标注。第 1–10 项为原十项审计,第 11–14 项为本轮(材料可理解性优化)新增。
| 审计项 | 判定 | 依据与处置 |
|---|---|---|
| 1. AI标识是否改变了来源信息之外的内容? | 干净 | 三个条件共用同一份 HTML 模板与同一份正文文本。AI披露标签仅在一个独立节点(.ai-wrap > .ai-chip)内渲染,不出现在标题、正文、三张信息卡、来源行、配图说明中。标题、发布日期、来源机构名、记者署名四个字段在 6 个条件中逐字相同。本轮改进:标签改为「AI 辅助 ⓘ」/「AI 生成 ⓘ」简短 chip,主标签均只有 5 个字符,视觉规格(位置、字号、颜色、圆角、内边距)三条件完全一致;完整说明放在点击 ⓘ 后的展开层。主标签只操纵"AI 参与程度"一个维度,不再出现"是否经人工核对 / 撰写"(旧版把这一条混在主标签里,等于同时操纵了两个维度)。 |
| 2. 一致/冲突是否改变了证据数量? | 干净 | 两版均为 3 组证据,编号与标题结构一一对应(证据一 / 证据二 / 证据三)。 |
| 3. 一致/冲突是否改变了来源可信度? | 干净 | 两版的三组来源标签逐字相同:「人因工程实验室《屏幕使用与视觉舒适度》项目报告」「人因工程实验室 · 眼表状态测试记录」「人因工程实验室 · 项目背景说明」。冲突通过结果方向制造,不是通过更换或贬低来源。 本轮改进:三条来源现在同属一个实验室,正文中不再有任何第三方权威(医院 / 医师 / 专家),因此排除了"来源可信度"与"权威依赖"两条替代解释。专家判断出现次数:一致版 0 / 冲突版 0(脚本实测)。 |
| 4. 一致/冲突是否改变了新闻长度? | 已配平 | 导语、正文第一段、结尾段、配图说明、信息一、信息三、折叠区结构完全一致。唯一差异是信息二的「结果方向」句与折叠区的一个数值。 字数由页面脚本实时计算(见下方核对表),目标:全文总字数差值 0,信息二正文字数差值 ≤ 1。 |
| 5. 一致/冲突是否改变了语言强度? | 干净 | 两版均使用同一套描述性语言,未使用"显著优于""完全无效""被推翻""存疑"等强度词,也未使用"不一致""冲突""矛盾""无法证明"等判断词。冲突版用的是「只有很小的变化」「差别不大」「并没有呈现同样明显的变化」——描述事实,不下结论。 |
| 6. 冲突是否过于明显? | 需预测试 | 本轮已把差异压缩到一句话:信息二的后半句。两版的信息二标题完全相同(同为「另一项观察指标」),差异只在正文最后一句。 但仍有一处提示性表述:「第一项指标…第二项…并没有呈现同样明显的变化」是一句显式的对比,会让细心的读者较快察觉。这一句是刻意保留的——完全去掉会让普通人读不出差异;但若预测试发现 Q2/Q3 正确率接近 100%,这一句就是首要的弱化对象。 处置:用「⑥ 材料理解自检」做预测试,目标正确率区间 80%–95%。 |
| 7. 参与者是否可能猜到研究目的? | 低—中(较上版下降) | 本轮消除了三个主要线索: ① 删除了证据三的裁判式专家结论——被试现在必须自己比较前两项结果,不会被告知"这里有问题"; ② 核验区标题从「你想进一步核实这条消息吗?」改为中性的「如果你希望进一步了解这项研究,可以查看以下相关材料」; ③ AI 标签改为真实平台常见的「AI 辅助 ⓘ」灰色 chip,不再是通栏说明文字。 残留风险:AI 标签本身仍在提示研究主题(这是自变量的必然属性,无法消除)。处置:加入一个与主任务无关的填充题(如"请评价这则新闻的写作风格")。 |
| 8. 是否需要专业知识? | 不需要(较上版改善) | 普通读者只需理解一件事:「第一项结果明显改善了,第二项结果好像没有跟着改善。」 本轮已确认正文中:p 值出现 0 次(全部移入折叠区「查看详细数据」)、统计术语出现 0 次("统计显著""显著水平"等一律删除)、专业指标名在正文中出现 0 次(正文只写"另一项与眼睛状态有关的指标";指标名"眼表状态指标"仅出现在折叠区)。数字(15 分 / 3 分 / +1.6 秒 / +0.2 秒)保留在第二层作为"数据感",但理解结论不依赖它们。 |
| 9. 验证行为是否真的代表"验证"? | 部分代表 | 4 个入口都包含能改变判断的实质信息(原始数据表含两实验室分歧、机构说明承认"无法确定"、独立媒体持质疑角度、事实核查给"部分属实、结论待定"),因此不是"点一下就算验证"。 但仍有两点不足:① Demo 无法记录滚动与阅读深度,只看停留时长;② 4 个入口被"摆好"了,与真实环境的"自己去搜"仍有距离。处置:正式实验建议记录每个材料的滚动深度,并加入一个开放式问题"你还想查什么"。 |
| 10. 两个自变量是否可以被理论上区分? | 可以 | AI标识操纵的是「谁/什么生产了这条内容」(来源·生产过程层);一致性操纵的是「这篇内容内部的几项结果是否互相支持」(内容·证据层)。两者分属不同层级,三条来源标签在两版中逐字恒定,因此构念上正交。这一点是本设计相对"来源可信度×内容"方案的决定性优势。 补充:本轮把 AI 标签从"通栏说明文字"改为"简短 chip + 展开",其视觉位置(署名行下方)、字号、颜色、圆角、内边距三条件完全一致,只改变文字(无 / AI 辅助 / AI 生成),不引入"人工是否撰写 / 核对"这一额外变量。 |
| 11. 专家 / 权威判断出现频率 | 0 次 | 一致版 0 次 / 冲突版 0 次(脚本实测)。这是本轮最重要的修改之一:原设计的证据三是「某三甲医院眼科医师访谈」,且直接评述前两项证据,会让被试跳过自己的比较直接采纳权威结论,把结果污染的路径从「线索冲突 → 验证行为」变成「统计理解困难 → 依赖权威来源」。现在证据三改为研究背景信息,不含任何判断。 |
| 12. 正文中的统计术语与 p 值 | 0 次 | p 值 0 次、统计术语 0 次(脚本实测)。所有统计信息收进默认收起的折叠区「查看详细数据」。重要的下游影响:p 值被移出正文后,"看懂数字的能力"不再是一个混淆变量;想看到统计数字的人必须去折叠区或核验材料,这本身也是可记录的信息行为。 |
| 13. 三张信息卡的视觉突出程度 | 等权 | 三张卡使用完全相同的样式:同背景、同左边条颜色与宽度、同内边距、同标题字号、同正文字号、同来源行样式,卡片之间无顺序暗示。 刻意未采用的做法:没有给每张卡加"护眼模式组:明显下降 | 普通设置组:变化较小"式的两行对照摘要——那会让冲突在一眼扫读中暴露,滑向"过于明显"。该版本保留为开发者开关(顶部「证据速览行」,默认关闭),你可以打开自行对比。 |
| 14. 开发者开关是否污染正式材料? | 默认关闭 | 「证据速览行」默认关闭;「高亮改动位置」只影响研究者视图。正式实验前请确认两个开关都处于关闭状态(顶部按钮的方块未点亮)。 |
|
⚠️ 审计发现的最大遗留问题:信息完整度仍然不对称(本轮已减轻,但未消除) 冲突版把"另一项指标没有明显变化"这一与核心结论不完全一致的结果放进了正文,而一致版没有。这意味着:冲突版在客观上更完整(外部核验材料显示两个实验室结果本就不一致)。这会让"结果不一致"与"信息完整度"发生混淆。 本轮已减轻的地方:① 冲突从"完全无效"弱化为"变化很小、差别不大",负面程度下降;② 证据三不再提供任何判断,被试不会得到"这里有正反两面"的提示;③ 外部核验材料在两版中完全相同,且显示"两个实验室结果本就分歧",因此一致版匹配实验室甲、冲突版匹配实验室乙,两版都各有一项外部证据支持、一项不支持。 仍未解决的地方:正文层面的不对称是本操纵的固有属性,无法靠配平措辞消除。处置:① 在论文"研究局限"中明确写出;② 或加一个"信息量控制组"(同长度、同信息数、但三项结果全为中性)来证明效应不来自信息量。详见「⑤ 分析与风险」。 |
||
核心依据是 Chaiken & Maheswaran (1994) 的原始实验:当内容与可信度启发式相矛盾时,仅由系统式加工决定态度;当内容不矛盾时,系统式与启发式加工各自独立地决定态度。
| 条件 | 按 Chaiken & Maheswaran (1994) 推演的心理过程 | 对本材料的预期 |
|---|---|---|
| 有AI标识 × 证据一致 | AI 标识提供一条来源启发式("机器生成/无人工监督");三组证据方向一致,没有反证挑战这条启发式 → 启发式独自完成判断 | AI 标识的效应被放大:可信度下降最明显,且判断成本最低、最不需要核验 |
| 有AI标识 × 证据冲突 | 证据内部出现方向相反的结果 → 内容与启发式推断相矛盾 → 系统式加工接管,判断更多依赖证据本身质量 | AI 标识的效应被削弱:可信度判断转向证据评价,核验倾向上升 |
| 无AI标识 × 证据一致 | 无来源启发式被激活(默认"人工撰写")→ 判断由内容线索主导 | 可信度基线最高,核验倾向最低 |
| 无AI标识 × 证据冲突 | 无来源启发式,但内容内部矛盾 → 触发内容层面的系统式加工 | 可信度中等,核验倾向较高(但小于 AI 标识 × 冲突?——这是需要检验的) |
| 困惑点 | 风险 | 说明与处置 |
|---|---|---|
| 「AI辅助生成」到底算不算"标注了AI" | 高 | MC1 让被试在"没有 / AI辅助 / AI生成"三选一,但现实中很多人会把"AI辅助"也归为"有AI"。处置:MC1 采用两段式——先问"是否有任何AI相关标注"(有/没有/记不清),再问"如果是,标注的具体表述是哪一种"。这样才能分辨是"没读到"还是"读到了但归类不同"。 |
| 把"证据冲突"读成"新闻是假的" | 高 | 一旦被试把主观/客观分歧读成"这则新闻在造假",因变量会从"验证行为"漂移到"真假识别"。处置:MC4 必须保留;若冲突组 MC4 显著更高,材料需要进一步弱化冲突措辞。 |
| 把"证据冲突"读成"信息不足 / 需要更多信息" | 中高 | 冲突版会让被试产生"信息不够"的感受,从而与"信息充分性"混淆。处置:测量感知充分性作为中介而非自变量(这正是上一份报告的建议),并在论文中明确"冲突是充分性缺口的前因"。 |
| 把材料入口当成任务要求 | 已消除 | 原措辞「你想进一步核实这条消息吗?」本身在暗示应该去核实。本轮已改为中性的「如果你希望进一步了解这项研究,可以查看以下相关材料」,并且把「暂不查看其他材料」提到第一位、与其余四项视觉权重完全相等(同边框、同字号、同内边距,无虚线、无默认高亮)。 |
| 看不懂数字 → 转而依赖专家 | 已消除 | 原设计的证据三是"三甲医院眼科医师访谈",且直接评述前两项证据——被试只要读证据三就知道该信什么,不需要自己比较证据一和证据二,实际测到的可能是"统计理解困难 → 依赖权威"而非"线索冲突 → 验证行为"。本轮:① 证据三改为不含判断的研究背景信息;② 正文中的 p 值与统计术语全部清除。现在被试只能靠自己读那句话来判断两项结果是否对得上。 |
| 冲突的那句对比会不会太直白 | 本轮新增风险 | 冲突版信息二结尾是「两项结果并没有呈现同样明显的变化」——这是一句显式的对比,是本设计里唯一"指引读者去比较"的表述。 它被保留是刻意的:完全删掉,普通人很可能读不出差异(就退回到"理解门槛过高")。但它也是"过于明显"的主要来源。 处置:用「⑥ 材料理解自检」测 Q2/Q3 正确率。落在 80%–95% 就保留;接近 100% 则把它弱化为「两项结果的变化幅度有所不同」。这是本轮最需要你用预测试数据拍板的一处。 |
| 三张信息卡是否需要"两行摘要" | 开发者可自行对比 | 你的指令里建议把信息一、信息二做成「护眼模式组:明显下降 | 普通设置组:变化较小」式的两行对照。我没有默认采用,因为它会让冲突在一眼扫读中暴露(两卡并列时"也出现明显改善"vs"只有较小变化"对比过强),滑向"过于明显"。 但它确实能降低理解门槛,所以做成了顶部开关「证据速览行」(默认关闭)。建议做法:先不开,跑一轮自检;若 Q2/Q3 正确率 < 80%,再打开重跑一次,比较两组的正确率差异。 |
| 怀疑"两个实验室为什么结果不同"而分心 | 中 | 外部材料中"实验室甲 +1.6 秒 / 实验室乙 +0.2 秒"可能引发被试对研究本身质量的怀疑,从而干扰主判断。处置:在机构说明中已保留一句"两实验室使用同一批受试者、同型号设备,差异主要来自测量时点与操作者判读",把分歧归因于正常的方法学差异而非"研究有问题"。 |
verification_type)。这比旧版"正文里就有 p 值、想不想看都一样"更能区分主动验证与被动阅读。
ai_manipulation_check 为因变量做卡方检验(预期:三组对其标识的识别率均 > 85%);以 consistency_manipulation_check 为因变量做独立样本 t 检验(预期:一致组显著高于冲突组,效应量 Cohen's d 建议 > 0.8)。credibility 为因变量做 3×2 被试间方差分析(AI_label 三水平、evidence_consistency 二水平)。重点看交互项 AI_label × evidence_consistency。verification(0/1)用二元 logistic 回归;verification_count(0–4)用 Poisson 或负二项回归;verification_type 用多项 logistic 或做各入口的二分类分解。need_verification 与信息回避。依据:Wang et al. (2025, N=3,920) 的随机实验发现冲突降低信息寻求意向——若你的验证行为结果与之相符,需要回避变量来解释机制。这是给研究者用的开发测试页,不进入正式实验、不写入被试数据。目的:验证普通读者在不理解 p 值、不了解专业指标的前提下,能否仅凭正文的自然语言答对下面几题。
参与者在「预测试模式」下的作答。字段含 material condition(研究者可见,参与者页面不可见),无个人信息。数据存于本机浏览器,刷新不丢失;换设备需参与者用完成页「复制我的回答」发给研究者。