Qwen3.5-9B-Humanize-DPO-Round2 运行效果

#1
by abing7k - opened

我在本地 MacBook Pro M4,16GB 内存 上测试了这个模型。
使用的模型是 Qwen3.5-9B-Humanize-DPO-Round2,基础模型是 Qwen3.5-9B 8bit GGUF格式 量化版本。
原文是AI生成的,1万字左右的论文。AI检测平台是朱雀AI检测助手。

测试结果:

原文:AI 特征 92.01%,疑似 AI 7.99%,人工特征 0%
第一次改写后:AI 特征 54.09%,疑似 AI 43.09%,人工特征 2.82%
第二次改写后:AI 特征 15.3%,疑似 AI 70.65%,人工特征 14.05%

降了两遍之后,人工特征提升率不高。

感谢测试~之前我没有在这个平台测试过,不过你可以尝试在这个2阶段的模型上继续做类似的合成数据和dpo,应该效果会有提升,因为目前这个版本只能算一个实验版。

另外确认一下测试的细节,是自动切分分段后改写再拼回,还是每次输入一个章节然后改写一整章。因为训练的分布上更偏一段的,可能一段一段改写再拼接效果好一些

This comment has been hidden (marked as Spam)

感谢测试~之前我没有在这个平台测试过,不过你可以尝试在这个2阶段的模型上继续做类似的合成数据和dpo,应该效果会有提升,因为目前这个版本只能算一个实验版。

另外确认一下测试的细节,是自动切分分段后改写再拼回,还是每次输入一个章节然后改写一整章。因为训练的分布上更偏一段的,可能一段一段改写再拼接效果好一些

测试部分我也是按照训练数据的格式,一段一段让它改写,然后拼接得到的。

另外我还有一个比较好的思路,就是在知网上批量下载2020年以前的论文。2020年以前的论文,AI率都是0。然后再让AI进行段落级改写,把AI率提高,再进行DPO的训练。训练数据也是段落级的。因为像这种AI检测报告,它的分析报告都是以段落级为基础,分析每一个段落的AI率是多少。

我也对千问模型进行微调,训练的是4B,8bit的小模型。由于数据量太少,以及本地配置太低,所以效果很有限

Sign up or log in to comment