Human Judgment Lab · 人类判断实验室
让人的判断,
成为 AI 的标尺。
沙盘是面向高校与研究团队的人类评估实验室。 我们把「哪一个更好」这个只有人能回答的问题,变成随机、可校验、可复现的研究数据。
为一家社区书店写一句开业标语
翻开一本书,就是推开一扇门。
本店图书种类齐全,欢迎广大读者光临选购。
- 单次时长
- 约 12 分钟
- 参与方式
- 手机即可完成
- 证件要求
- 不采集任何证件
- 数据存储
- 中国境内服务器
01我们解决什么
AI 能生成无数个答案,
「哪一个更好」只能由人来回答。
文案能否打动人、图像是否耐看、解释是否讲得明白——这些问题没有标准答案,自动指标给不出可信的结论。 研究团队真正需要的,是真实、多元、经得起复现的人类判断。
评审者来源单一
只靠少数几位标注员,结论很难代表真实人群,也看不出专业背景带来的差异。
连接不同学校、专业与学段的在校评审者。研究团队可以按学历、学科或学校设定参与条件。
认真与敷衍混在一起
没有校验机制的问卷里,认真思考和随手乱点看起来一模一样。
作答中穿插外观一致、有客观答案的检查题,结合作答时长识别异常样本。每一份数据先核对,再交付。
结论难以复现
题目顺序与左右位置都会左右选择,事后很难说清每个人究竟看到了什么。
每位评审者的呈现方案由一个种子生成,并在同意的那一刻固化。任何时候都能逐题重放核验。
隐私与合规风险
作答数据和个人身份混在一起,任何一次导出都可能带出手机号。
身份与作答数据分层存储。研究团队只拿到随机编号和匿名群组标签,看不到手机号,也看不到校名。
02工作方式
一套流程,
连接研究团队与评审者。
- 1
手机号注册
收一条验证码即可,无需设置密码,也不需要上传任何证件。
- 2
填写学业档案
学校、学历与专业,用来为你匹配合适的研究项目。校园邮箱验证后可获得「已验证」标识。
- 3
阅读知情同意
每个项目都写明发起机构、研究用途与会用到的数据,你主动勾选同意后才会开始。
- 4
开始评审
先做一两道练习熟悉操作,然后在两个结果之间选出更好的那一个。
AB每一道题,都是在两个结果之间做出的判断。
Pairwise03研究方法
严谨,是研究的底线。
一份评审数据能不能用,取决于它是怎样被收集的。我们在每个环节都按实验研究的标准来设计,并且让每一步都可以被核验。
逐题一致
随机,且可以复现
每位评审者看到的题目顺序与左右位置都经过随机化;整套方案由一个种子生成,并在同意的那一刻固化。任何时候都能逐题重放,与当时的呈现一一对照。
请选择画面中带有红点的那一张
检查题 · 外观与普通题一致
注意力校验
作答中穿插外观相同、但有客观答案的检查题。答案不下发到浏览器,只在服务端判定。
精确计时
从画面真正呈现在屏幕上的那一刻开始计时。素材加载时间单独记录,不混入作答用时。
身份域
- 手机号 ••••••
- 学校
- 出生年份
研究团队可见
- 会话 s_8f2c…
- 学校 C2
- 第 07 题 B · 1.28s
身份与数据分离
作答数据与个人身份在存储层面分开保管。研究团队拿到的只有随机会话编号与匿名群组标签,这条边界由代码在编译期强制检查。

04数据与隐私
研究团队
看不到你是谁。
你留下的是判断,不是身份。
没有手机号,也没有校名
研究者拿到的数据里只有随机会话编号,学校被替换成 C1、C2 这样的匿名标签,且在不同项目之间无法对应。
手机号加密保存
手机号在数据库中加密存储,密钥与数据分开保管。你可以随时申请更正档案或删除账号。
不采集任何证件
平台没有身份证、人脸、学生证照片或银行卡的采集入口,系统里连存放它们的字段都没有。
05关于评审者
你的专业,
就是研究需要的视角。
设计专业的人看构图与审美,文科生看表达与语感,理工科看逻辑与准确。 不同背景的判断,恰恰是一项研究最需要的多样性。
- 单次评审时长
- 12分钟
- 中途离开可断点续答
- 24小时
- 同一项目限参与一次
- 1次
- 需要上传的证件
- 0份
06常见问题
参与之前,
你可能想知道。
- 适合对象
- 在校学生与毕业生,年满 14 周岁
- 参与次数
- 同一项目限一次,可参与多个项目
- 作答窗口
- 同意后 24 小时内完成,可断点续答
大多数项目对专业没有限制——很多研究恰恰需要不同背景的人给出判断。少数项目由研究团队指定了专业或学历范围,不符合的项目会在列表中标明原因,不会隐藏。

