粘一段中文进去 → 得到一个「有多像 AI 写的」评分、一句话结论,以及在原文里直接标出来的可疑片段。 两条通道:本地初筛(纯 JS,边打字边算,不联网、不限量)与模型判读(看语义,有限试用)。
| 场景 | 没有它的时候 | 用它之后 |
|---|---|---|
| 写完一段,想知道「AI 味重不重」 | 凭感觉,或者整篇粘进某个来路不明的检测站 | 粘进来先跑本地初筛:不联网、不限量、秒出,先看表面特征够不够干净 |
| 知道 AI 味重,但不知道改哪句 | 只有一个总分,只能整篇重写 | 模型逐条给出可疑片段 + 为什么可疑,并在原文里高亮,鼠标悬停看理由 |
| 不想给任何人留下正文 | 在线检测站默认留库 | 本地初筛在你的浏览器里算完;要更严格就用本机 app(正文不出本机) |
| 额度用完了 / 不想排队 | 只能等 | 填自己的 API key,浏览器直连模型厂商,不受本站额度限制 |
| 分数 | 量程 | 看的是什么 | 成本 |
|---|---|---|---|
| 本地初筛分(本页) | 0–100 | 只看表面特征:句长方差、连接词密度、四字格密度、段落整齐度、套话词密度、标点多样度。不理解语义,一段有意写得工整的人类公文一样会被打高分 | 零,纯 JS 本地算 |
| 模型判读分(本页) | 0–100 | 看语义:论述套路、观点空转、比喻陈旧、信息密度、有没有具体到不可替换的细节 | 占额度,每次约 10–30 秒 |
| 采样差异度 d(本机 app) | 约 −4 ~ +4 | 统计量,不是百分数:文本用词有多贴近打分模型的最高概率选择(原理见第 5 节) | 本机推理,分钟级 |
| 特征 | 怎么算 | 为什么它有信号 | 权重 |
|---|---|---|---|
| 句长变异系数 | 各句字数的标准差 ÷ 均值 | 人写的句子忽长忽短,模型直出的句子长度扎堆。越低越可疑 | 24 |
| 连接词密度 | 「首先 / 其次 / 综上 / 值得注意的是」等命中数 ÷ 句数 | 模型爱把论述骨架显式说出来,人写常省略 | 20 |
| 套话词密度 | 「赋能 / 助力 / 深刻 / 至关重要」等命中数 ÷ 百字 | 高频抽象词是最省事的填充物 | 24 |
| 段落长度整齐度 | 1 − 段落字数的变异系数(需 ≥3 段) | 每段都差不多长 = 按模板生成的痕迹 | 14 |
| 四字格密度 | 内置四字词表命中数 ÷ 百字 | 成语堆砌常见于「显得有文采」的直出文本 | 12 |
| 标点多样度 | 破折号 / 省略号 / 问号 / 感叹号 / 括号 ÷ 百字 | 人写有停顿、犹豫、插话;直出文本标点极其规矩。越低越可疑 | 6 |
本页的两个分数都是「够用」的近似。真正的统计判据在本机 app 里:Fast-DetectGPT 的解析式采样差异度 —— 用一个开源基座模型(Qwen2.5)对文本做一次前向,在每个 token 位置拿到三个量,合成一个标准化的差值:
| 符号 | 是什么 |
|---|---|
| 这段文本的采样差异度,也就是 app 界面上那个总分 | |
| 第 i 个位置上,实际出现的那个词的对数概率 log p | |
| 同一位置,模型自己采样的对数概率期望 E[log p](对整个词表求和) | |
| 同一位置该期望的方差,用来把差值标准化,长短文本才可比 | |
| 参与打分的 token 数(每块首 token 没有预测上下文,不算) |
拿三个 token 的最小例子手算一遍。假设某段实际用词的对数概率是 ℓ = (−0.20, −0.35, −0.15),同位置模型自采样期望是 μ = (−1.40, −1.60, −1.30),方差 σ² = (0.50, 0.80, 0.45):
Σℓ = -0.20 + -0.35 + -0.15 = -0.70 Σμ = -1.40 + -1.60 + -1.30 = -4.30 分子 = -0.70 - (-4.30) = 3.60 Σσ² = 0.50 + 0.80 + 0.45 = 1.75 分母 = sqrt(1.75) = 1.3229 d = 3.60 / 1.3229 = 2.72 → 落在 ≥1.5 档 → 「强 AI 指纹」
读法就写在数上:实际用词的概率(−0.70)远高于模型随手采样的平均水平(−4.30), 说明这段话句句都挑在模型最想说的词上 —— 这正是未经修改的大模型输出的特征。 人写的文字会夹着低概率的突兀选择,分子随之缩小甚至变负: 把上面的 ℓ 换成 (−3.10, −0.90, −4.20),分子变成 −8.20 −(−4.30) = −3.90,除以同一个 1.3229, d = −2.95,落进「未见明显 AI 指纹」。 相比原版 DetectGPT 要反复扰动文本重打分,这个解析形式只需一次前向, 所以一份长文档在个人电脑上是分钟级而不是小时级。
这两个不是同一件东西的两种打包,是两种隐私成本:
| 本页(在线) | 本机 app | |
|---|---|---|
| 正文去哪了 | 本地初筛留在浏览器;模型判读会把正文发给模型厂商(走本站通道时先经过本站中转) | 一个字都不出本机,权重下载到本地,推理在本地 CPU / GPU 跑 |
| 装不装 | 打开网页就能用 | 要装 app + 下模型权重(约 4.7 GB 内存峰值) |
| 额度 | 每 IP 每天 8 次;自带 key 则不限 | 不限,自己的电脑自己烧 |
| 能吃什么 | 粘进来的纯文本 | 整份 .docx / .md / .txt,出块级热力条与句级修改优先级,可导出 HTML 报告 |
| 适合谁 | 随手试一段、判断值不值得装本机版 | 要检自己没发表的论文 / 报告 —— 这种稿子不该出现在任何在线框里,包括本页 |