PaperFake 开源 Qwen30.6B 降重模型:老旧电脑也能流畅运行论文改写
在学术研究与写作领域,降低论文重复率(Plagiarism Rate)与 AI 生成检测率(AI Detection Rate)是许多用户面临的痛点。今天,PaperFake 团队宣布将核心降重模型开源,旨在打破技术壁垒,让有价值的工具不再局限于少数人的私有工具箱。
核心突破:极致轻量化与本地化部署
本次开源的模型并非通用的文本生成模型,而是专为中文文本降重场景定制的指令微调(Instruction Fine-tuning)模型。其核心架构基于 Qwen30.6B 底座,通过 LoRA 和 QLoRA 技术进行轻量化微调,最终导出为 GGUF 格式(采用 Q4_K_M 量化规格)。
这一技术路线带来了显著的硬件友好度提升:
- 极低硬件门槛:经过深度量化优化,模型对显存和内存要求极低,老旧电脑的 CPU 即可在 Windows 系统下流畅运行。
- 离线自主运行:用户无需依赖云端 API,可完全本地部署,保障数据隐私。
- 稳定性增强:针对过往用户反馈的启动闪退及缺失 VC 运行库问题,新版模型内置一键自动修复功能。
训练方案:从数据清洗到人工复核的闭环
PaperFake 团队重新规划了整套训练落地流程,确保模型在降低重复率的同时不牺牲学术严谨性:
- 数据构建:收集中文论文摘要、正文片段、行业报告及人工改写对标素材,构建高质量语料库。
- 数据提纯:剔除乱码、广告、固定模板语句及语义偏差过大的无效样本。
- 成对样本构建:搭建“原文 - 改写版”配对,作为有监督微调(SFT)的核心素材。
- 指令封装:按照 System/User/Assistant 规范封装对话数据,适配大模型推理接口。
- 微调与评估:采用 LoRA/QLoRA 进行快速校验,从语义匹配度、重复文本降幅、篇幅波动、关键词留存率等多维度量化评估。
- 人工复核:重点排查事实跑偏、术语缺失及逻辑断层问题,确保改写后的文本符合学术规范。
- 迭代优化:将异常样本回流至下一轮训练,形成持续优化的闭环。
实用价值:开发者与用户的最佳选择
该开源项目不仅提供了模型文件,还配套了完整的部署方案,支持两种主要使用模式:
- 网页工作台模式:用户直接在
index.html前端页面粘贴文本,调用本地接口实时完成改写。 - Word 批量处理模式:通过
rewrite_docx_gpu_parallel.py脚本,按段落解析 DOCX 文档,以并行方式批量生成改写结果。
⚠️ 重要提示:该模型专注于降低重复率,而非直接降低 AI 生成检测率。由于改写过程可能增加文本的“自然度”从而提升 AI 检测率,建议用户搭配专门的 AIGC 降重模型组合使用,以达到最佳效果。
通过保留原文语义、事实逻辑与专业关键词,重构句式结构,PaperFake 开源模型致力于让学术写作更加自由、高效且安全。
本文基于 PaperFake 官方开源公告编译整理。