论文查重字数统计
字符数(不计空格)· 中英混排分解 · 查重计费估算 · 正文不上传
📖 使用说明
- 粘贴论文正文(按章节分别粘也行),工具会实时给出各口径的字数与字符数。
- 填上你所用查重系统的单价,估算这轮查重大约要花多少钱。
- 对着分解表检查:英文术语多不多、标点占比高不高,这些会直接影响字符数。
- 查重报告里的"总字数"和自己数的对不上时,先分清对方用的是哪一列口径, 再决定要不要删改正文。
❓ 常见问题
Q:查重按字数还是按字符数计费?
A:主流系统多按字符数计费且不计空格,部分系统的报告会同时给出总字数与总字符数。 本站把三种口径都列出来,计费估算按"字符数(不计空格)÷ 1000 向上取整 × 单价"计算, 单价可以自己填。
Q:为什么和知网报告里的数字略有差异?
A:各系统对空格、全角标点、公式、图表题注、参考文献、致谢的处理规则并不统一, 报告里的数字是系统按自己的规则算出的。本站统计的是通用口径,用于估算与自查, 不能替代系统报告的最终数值。
Q:论文内容会被保存吗?
A:不会。粘贴的正文只在浏览器内存中参与计算,不发请求、不落盘、不写本地存储, 刷新或关闭页面就消失。也正因为如此,工具不联网就没法帮你"查重"—— 查重需要比对库,那是另一回事。
🧮 口径差异是怎么来的
"我的论文多少字"这个问题有多个正确答案,因为分母的定义不同。设一段文本里汉字数为 H、中文标点数为 P、英文单词数为 W、 数字串数为 N、非空白字符总数为 C,两种常见口径写成公式是:
近似字数 W_total = H + P + W + N
字符数(不计空格)C = 所有非空白字符逐个计数
两者的差就出在英文和数字上:一个 8 个字母的英文单词,在字数口径里是 1,在字符数口径里是 8, 差 7。所以中英混排的论文里,字符数往往比字数大一截,而差多少完全取决于英文占比—— 上面的"字数与字符数之差"就是按你粘贴的正文实时算出来的。
查重的重复率同样是"分子除以分母":重复率 = 重复字符数 / 总字符数 × 100%。 分母口径一旦变化,同一个重复片段算出的重复率就会变,这也是不同系统给出不同百分比的原因之一。 能确定的是:无论用哪种口径,先把总字符数算准,后面的估算才有意义。
🧾 示例演算
以示例段落为例:
本文提出一种基于图神经网络(GNN)的推荐算法,在 MovieLens-1M 数据集上将 Recall@10 提升了 4.7%。
| 项目 | 数值 | 推导 |
|---|---|---|
| 字符总数(计空格) | 64 | 无 emoji,故码元数 = 字素簇数 = 64 |
| 字符数(不计空格) | 59 | 64 − 5 个空格("在 MovieLens-1M 数据集"等处) |
| 字符数(不含标点) | 51 | 59 − 8 个标点((),。−@.% 等) |
| 近似字数 | 38 | 汉字 27 + 中文标点 4 + 英文单词 4(GNN / MovieLens / M / Recall)+ 数字串 3(1、10、4.7) |
| 字数与字符数之差 | 21 | 59 − 38:英文与数字在两种口径下的记数方式不同所致 |
| 计费(单价 1.5 元/千字符) | 1.50 元 | ceil(59 / 1000) = 1 个单位 × 1.5 元 |
注意最后两行:字符数 59 与近似字数 38 差了 21,说明这段中英混排文本里, 英文和数字占了相当比重。若把整篇论文按 3 万字符估算,单价 1.5 元/千字符时, 单次查重约 45 元——这比"按字数"估算高出不少,投稿前值得先算清楚。
🎯 适用范围
- 毕业论文、课程论文、职称论文投稿前的字数自查与查重花费估算。
- 期刊投稿系统要求"不超过 N 字符"时,核对当前稿件是否超限。
- 翻译、润色按字符数结算时的工程量核对。
- 不适用于:声称能给出"与知网完全一致的字数"的场景(规则不公开,做不到); 也不提供查重比对本身,本站没有比对库,也不应把你未发表的内容传上去。