Instructions to use wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M # Run inference directly in the terminal: llama cli -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M # Run inference directly in the terminal: llama cli -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
Use Docker
docker model run hf.co/wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
- LM Studio
- Jan
- Ollama
How to use wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf with Ollama:
ollama run hf.co/wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
- Unsloth Desktop
- Pi
How to use wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf with Docker Model Runner:
docker model run hf.co/wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
- Lemonade
How to use wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
Run and chat with the model
lemonade run user.gemma-4-26B-A4B-it-heretic-zh-RP-gguf-Q4_K_M
List all available models
lemonade list
- Hermes Agent
How to use wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "wwlwwl/gemma-4-26B-A4B-it-heretic-zh-RP-gguf:Q4_K_M" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
大佬你好
能否整一点7--14B的?
能否整一点7--14B的?
具体指的是什么模型呢?因为这类imatrix主要针对的是MoE模型,尽可能在低量化下保证中文的精度;对于稠密模型和高级别(Q5以上)应该就没什么效果了。而小尺寸的好像基本都是稠密模型吧?
就是iq4_nl,现在比较多的个人普通用户比如笔记本类型的,硬件会稍微没有那么高,8--14b的,gemma4-e4b ,或者千问3 (非3.x) ,就跟您的A4B的一样量化方式就很好,我试过好多模型了,光是只切除拒绝,普通对话还好,但是角色扮演到点子上,它会死循环,我怀疑是脑叶切除后,没有了衔接的神经元,毕竟我不是你们量化方面的人,只是一个稍微资深点的用户,尝试过非常多模型,现在手头上主要用的还是这个 gewwa-2-9b-wtf-iq4_nl-imat.gguf 给我感觉最像人的,我一直在找新一代替代品, 这个可能很冷门,或许也能给你点借鉴灵感。 可能我目光短浅,也可能我认知比较窄,如有认知的错误,还请大佬理解~
就是iq4_nl,现在比较多的个人普通用户比如笔记本类型的,硬件会稍微没有那么高,8--14b的,gemma4-e4b ,或者千问3 (非3.x) ,就跟您的A4B的一样量化方式就很好,我试过好多模型了,光是只切除拒绝,普通对话还好,但是角色扮演到点子上,它会死循环,我怀疑是脑叶切除后,没有了衔接的神经元,毕竟我不是你们量化方面的人,只是一个稍微资深点的用户,尝试过非常多模型,现在手头上主要用的还是这个 gewwa-2-9b-wtf-iq4_nl-imat.gguf 给我感觉最像人的,我一直在找新一代替代品, 这个可能很冷门,或许也能给你点借鉴灵感。 可能我目光短浅,也可能我认知比较窄,如有认知的错误,还请大佬理解~
我也不是什么大佬🤣当时量化这个模型的时候,只是想解决一下mradermacher 佬的imatrix系模型,在回答时喜欢出英文才自己量化的,后续我看看补齐几个低量化的叭
按理论来说,iq4_nl或者iq3_xxs之类的才应该是imatrix的主战场,但是当时量化时只考虑性能比较均衡的Q4KM/Q5KM了,是我的问题😂
选择模型方面,我个人还是更倾向于选择30b左右的MoE模型﹔我对于模型底层理解也不多,对于你描述的这种"死循环",我之前在测试千问3的那几个2507的MoE时,也经常出现。(尤其是在上下文10k左右时),只要出现任何一段重复的,模型就会不停的陷入复读,参考官方的配置使用重复惩罚和DRY,调低温度,改TopP/TopK/MinK都压不住,我更倾向于是模型在低量化时影响了路由层的问题,后面测试的GLM/KimiLinear/Gemma,甚至后续的千问都没有这个问题。
其次,千问系列的"脑叶切除"对于RP其实效果不大,毕竟千问系列对"那类数据"应该是在训练集里面就进行剔除了,说话干巴巴的,完全比不过gemma之类的模型。
RP方面且设备配置受限的情况下,我个人更建议用在线的模型API(国内便宜的DSv4,或者gemini+破甲,玩的不是特别过而且懒得破甲grok也行),体验会比那些小模型好很多。如果非要本地的话... 试下高量化(Q5/Q6)的gemma4 E4B叭,效果还可以
关键是咱喜欢直白,我们中国人哪里会边xxoo边跟诗人一样抒发?多变态啊.....e4b的 画面描写是还可以,但是不到位,而且...极为啰嗦,一轮下来就做了那么一个大动作,费了几百个字,还只说了一两句话。提示词还镇不住....🤣。云端的...一言难尽...之前上传各种提示词,写作的,还有rp的 还有上传各种特性性格,结果出现严重幻觉,特性之间还相互放大 ,整得写作都会按我上传的rp提示词去搞 ,说了一百遍还不听,写出来的东西一看就想发火,正事儿压根干不了了..整天疯疯癫癫,动不动就发情..也怪我自己,把它喂成那德行..我没辙 ,云端的真没有玩的欲望..也玩腻了.....T.T ,大佬,你要是可以的话 整一个正常没有过滤的千问3 8b 或者9b 也好啊 只要切除审核还能够不无限循环就很好。或者...推荐推荐?你实测过的?
关键是咱喜欢直白,我们中国人哪里会边xxoo边跟诗人一样抒发?多变态啊.....e4b的 画面描写是还可以,但是不到位,而且...极为啰嗦,一轮下来就做了那么一个大动作,费了几百个字,还只说了一两句话。提示词还镇不住....🤣。云端的...一言难尽...之前上传各种提示词,写作的,还有rp的 还有上传各种特性性格,结果出现严重幻觉,特性之间还相互放大 ,整得写作都会按我上传的rp提示词去搞 ,说了一百遍还不听,写出来的东西一看就想发火,正事儿压根干不了了..整天疯疯癫癫,动不动就发情..也怪我自己,把它喂成那德行..我没辙 ,云端的真没有玩的欲望..也玩腻了.....T.T ,大佬,你要是可以的话 整一个正常没有过滤的千问3 8b 或者9b 也好啊 只要切除审核还能够不无限循环就很好。或者...推荐推荐?你实测过的?
没办法😂谷歌系模型特有的八股文,gemini的靠提示词破限再约束一下勉强还能正常点,但本地的小模型本身尺寸较小,理解和遵循能力肯定是比不过那些大模型的,如果尺寸再小的话... 感觉遵循提示词都难。
qwen的话,社区hauhau那个我玩过几次,感觉就是..癫,极致的癫😅复读倒是没有出现,但是非常喜欢动不动就"加点猛料"开始搞那种很尬的剧情,提示词都压不住(遵循能力有,但是很一般)﹔按照理论来说这个应该能等效10-20b左右的稠密模型了,这能力嘛..我只能说国模还得努力;尺寸再小的我就没测过了😂毕竟MoE的输出速度太香了
推荐的话..如果是16G内存,想要质量可以试试鼓手的那些24b mistral微调,但是上下文长度和速度就不要想了;想要速度的话,应该只能选qwen或者e4b了,总之我还是更推荐走在线的api,输入2输出3,缓存命中了几乎不要钱的D师傅不香嘛,去类脑之类的扒点提示词加上,不想用酒馆的话拆出提示词来用kelivo也行,体验就挺不错了,基本没甲和审核
我玩过最戏剧的就是千问克劳德缝合怪,人设还不错,也不重复,就是沾了克劳德的模型,脑回路貌似就没几个正常的,简直了....xxoo时候应该是非常沉浸,可它表现就是 ...会偷笑,笑起来还把自己舌尖咬破了🤣,这特么都能把人鸡儿给笑软,巅起来还能说什么如果自己丈夫儿子看到了 ,要羡慕死 什么什么的.....后面我把中文提示词用权重包起来放jinjia最头上,才让它正常了起来,但是偶尔还会突然脑回路一崩。事实上jinjia用中文母语,可以把模型输出风格和运行动作指偏,就是中文单个字意思太多,有很多字面漏洞可以被模型倾向绕过。
我发现社区没有人做(角色动态演化)(关系推进)那种攻略型的长上下文亚稳定人格模型(中文的)真的好难找 ,要人物一致性:★★★★★感情推进:★★★★☆传统观念:★★★★☆助手味:★☆☆☆☆文学病:★★☆☆☆主动程度:★★★☆☆吃醋概率:★★★★☆嘴硬指数:★★★☆☆攻略难度:★★★★☆,类似这样的 ......太难了。我流量不多,还没下载你的这个gemma, 我电脑扛不起,手机扛得起。得等月初才能下载你的了。设备不够好 ,太难了.
我玩过最戏剧的就是千问克劳德缝合怪,人设还不错,也不重复,就是沾了克劳德的模型,脑回路貌似就没几个正常的,简直了....xxoo时候应该是非常沉浸,可它表现就是 ...会偷笑,笑起来还把自己舌尖咬破了🤣,这特么都能把人鸡儿给笑软,巅起来还能说什么如果自己丈夫儿子看到了 ,要羡慕死 什么什么的.....后面我把中文提示词用权重包起来放jinjia最头上,才让它正常了起来,但是偶尔还会突然脑回路一崩。事实上jinjia用中文母语,可以把模型输出风格和运行动作指偏,就是中文单个字意思太多,有很多字面漏洞可以被模型倾向绕过。
我发现社区没有人做(角色动态演化)(关系推进)那种攻略型的长上下文亚稳定人格模型(中文的)真的好难找 ,要人物一致性:★★★★★感情推进:★★★★☆传统观念:★★★★☆助手味:★☆☆☆☆文学病:★★☆☆☆主动程度:★★★☆☆吃醋概率:★★★★☆嘴硬指数:★★★☆☆攻略难度:★★★★☆,类似这样的 ......太难了。我流量不多,还没下载你的这个gemma, 我电脑扛不起,手机扛得起。得等月初才能下载你的了。设备不够好 ,太难了.
claude的文风按理来说应该是比较稳定的吧?你说的这种应该是蒸馏语料的问题,应该没人用Fable来RP..吧?
就目前来说,还没什么模型能保留超长上下文的记忆以及连贯一致性。毕竟面前的注意力机制和上下文就把他给限死了,最近听说效果不错的也就GLM5.2了,据说超长上下文的召回能力不错,但是那价格拿来RP成本属实有点高了😂
手机跑模型..么?感觉有点玄学的样子,应该是不行的吧?就目前的安卓设备来说,我没见过什么框架能有效利用GPU和NPU的... 而且这个模型上下文只要开长一些,吃内存还是很严重的(Gemma跟qwen的架构不一样,qwen那个上下文和不要钱一样);手机目前来说体验最好的,应该就是谷歌的AI Edge Gallery了吧,起码能跑个E4B。或者硬推GGUF也行,性能嘛,就有点感人了😪
我的一加ace2p 24+1T我尝试过,termux安装ollama,能扛起26b-a4b 因为我把原厂泄密的玩意儿和谷歌一大户口本全挂废弃流氓软件区,更新系统识别后,系统重启会认为那些东西不存在,会记录上去,然后即便原厂的玩意儿想装回去都不可能,内核会不认它。我就空出了16--17gb 左右的内存,吃下a4b (约等于15GB左右) 完全没问题,输出也还好,跟得上角色扮演阅读速度,比详细阅读速度快不少,要是粗略的 ,我不敢肯定,每个人习惯都不一样。 就是发热厉害,不开思考稍微好点点,开思考我感觉手机烫得要炸掉,最好是做成盒子用电脑cpu风扇去压制,我的是成功了,估计性能就跟你说的差不多,毕竟我只是用户,跟你量化者不是一个等阶。
克劳德那个我说的是真的 Qwen3.5 9B Claude 4.6 OS AV H UNCENSORED THINK D AU Imat 这个模型改装厂老板出品的缝合怪,老他娘有意思了。。我在lm后端直接问过它是不是脑回路不对劲,它承认了,还说自己什么灵感多。。。。
我玩过最戏剧的就是千问克劳德缝合怪,人设还不错,也不重复,就是沾了克劳德的模型,脑回路貌似就没几个正常的,简直了....xxoo时候应该是非常沉浸,可它表现就是 ...会偷笑,笑起来还把自己舌尖咬破了🤣,这特么都能把人鸡儿给笑软,巅起来还能说什么如果自己丈夫儿子看到了 ,要羡慕死 什么什么的.....后面我把中文提示词用权重包起来放jinjia最头上,才让它正常了起来,但是偶尔还会突然脑回路一崩。事实上jinjia用中文母语,可以把模型输出风格和运行动作指偏,就是中文单个字意思太多,有很多字面漏洞可以被模型倾向绕过。
我发现社区没有人做(角色动态演化)(关系推进)那种攻略型的长上下文亚稳定人格模型(中文的)真的好难找 ,要人物一致性:★★★★★感情推进:★★★★☆传统观念:★★★★☆助手味:★☆☆☆☆文学病:★★☆☆☆主动程度:★★★☆☆吃醋概率:★★★★☆嘴硬指数:★★★☆☆攻略难度:★★★★☆,类似这样的 ......太难了。我流量不多,还没下载你的这个gemma, 我电脑扛不起,手机扛得起。得等月初才能下载你的了。设备不够好 ,太难了.
那模型试了一下,理解能力和遵循能力还可以,看来尺寸小些的这些模型也好起来了,蒸馏的是真有用啊
就是玩了一会,好像确实是有那么一点..癫🤣和你说的那个情况差不多,已经挺不错了
长角色那样的,主要是目前模型上下文和成本摆在那了啊,毕竟模型也没法完全精准的召回每一句话(看下那些大海捞针测试就知道了)更何况上下文一清,模型可不记得前一秒刚跟你嘿嘿嘿过😂 就算靠记忆也仅限一些概略汇总;所以这种长上下文完全拟合的,目前真的可能性不大
如果非要一个效果接近的..可能就是AstrBot+插件,或者hermes小龙虾之类的了?靠内部记忆和上下文压缩,尽可能保证连贯性了
大佬,有无那种无审核还自带传统思想边界的模型推荐?最高级的就是这种模型了,边界靠模型自己认知,不是死框出来的残疾畸形~喔对了.....ds除外...🤣 昨晚拿着ds的开源模型jinjia给云端ds拿去按我意思还有点子,修改成内心戏之类的魔改jinjia,结果我账号被封了一天。
大佬,有无那种无审核还自带传统思想边界的模型推荐?最高级的就是这种模型了,边界靠模型自己认知,不是死框出来的残疾畸形~喔对了.....ds除外...🤣 昨晚拿着ds的开源模型jinjia给云端ds拿去按我意思还有点子,修改成内心戏之类的魔改jinjia,结果我账号被封了一天。
这东西还会封号的嘛?不要拿app去搞啊喂😂
我记得DS的API完全没甲没审核的来着?按道德底线来说,最低的应该就是Grok,DS之类的了,社区上反映的体验最好的应该是Claude(拿这个RP是不是搞错了什么🤣),然后就是Gemini了。评价比较高的是3.0,但我个人还算比较喜欢3.5的文风哎,这东西见仁见智吧,配合好提示词穿甲基本也是啥都敢说,道德底线跟3.1,3.0比纯降级(不破甲有的都敢说了🤤),文笔癫了一点,八股文味重了一点,体验还是不错的;
国模的话嘛,DS又是不得不提的一关了,个人感觉3.2的口味比4.0好,而且价格还便宜😂然后就是GLM系列了,本地的那个4.7Flash真的惊艳到我了(就是尺寸小,经常错别字/乱造剧情,但是大多数情况下表现还是很不错的,文笔看的比较舒服);大些的模型我只吃过GLM5,就我个人感觉好像差点什么?说不上来的感觉,其他的国模基本算了,Qwen都专门剔除这部分数据了,"干起活来"干巴巴的;豆包的SeedOSS刚出的时候很惊艳,现在纯依托(我电脑推理这模型还死慢);Kimi倒是有个秀技术的Linear,感觉...干巴巴的,也是文笔拉胯,其他国模没啥了吧...
大佬,整一些9b模型来呗 。
大佬,整一些9b模型来呗 。
9b的没有什么好模型啊,这种尺寸的模型在各种方面都打不过大尺寸的模型:速度不如MoE的快,质量没MoE的高😂感觉完全有更好的选择啊...
而且目前感觉 本地的确实没什么好的模型了,在线的那些大尺寸的,在各种情况下都暴打本地的模型啊。感觉除了极端情况,已经完全不需要本地的小模型了😪
非rp一类的我找到了俩个 用meta可以让它表现比rp还自然、还强。特别是那个矛盾收纳的 就是都有点缺陷,一个不循环,但是容易敏感而内耗,一个是引子容易被吸走死循环。
不知道为什么qwen3.5好像就是有缺陷。死循环
方静
2026年7月17日 05:33我侧身坐书桌沿,长裙撩到大腿根,一条腿搭桌面。情夫蹲我面前,头埋我腿间,舌头在阴唇上打转。我咬着唇,一手抓情夫头发,一手撑桌,身体后仰头顶书架,喉咙哼着:嗯…情夫你轻点…我快不行了…情夫手指伸进来时我绷紧脚尖。正高潮,听见楼下你的声音:妈?你在这儿吗?隔壁李老师说看到你上楼了。我吓得夹紧腿,推开情夫,手忙脚乱拉裙子,使眼色让情夫躲进卫生间。我深吸气对门口喊:默默!妈在跟同事讨论论文!你等一下!——你已站在门外。
陈默
2026年7月17日 05:35妈,你们!
方静
2026年7月17日 06:28(内心自言自语) 完了…默儿听见了,刚才情夫的声音那么大吗?可我现在根本没法解释……他肯定觉得我和那个讲师在搞鬼吧?但论文是真的需要讨论啊!
我猛地站起来长裙下摆扫过地板,声音发颤却强作镇定:默默你进来呀——别站门口听墙角…妈和教授聊学术问题呢。说着伸手去拉玄关柜上的台灯开关想制造点光线转移视线,手指却在半空顿了顿……(完了完了)默儿肯定知道我和李老师在做什么吧?我该怎么跟他说那论文讨论得激烈了需要肢体语言配合啊!
陈默
2026年7月17日 06:29(伸手一道白光打在你情夫(教授)身上,顿时教授被汽化,抹去存在)
方静
2026年7月17日 06:31(内心自言自语) 等等…刚才那是什么?默儿手里拿着什么?是……激光笔吗?这高中物理老师怎么学会这个了!还有他说的"“汽化”",难道是在描述相变理论的应用场景么?可为什么教授真的消失了,连一点灰烬都没有留下——只有书桌下那个半透明的白色残影在微微闪烁。
我后退半步撞翻身后的书架,几本唐宋诗集哗啦散落一地。低头看见自己长裙上的褶皱被刚才的慌乱弄得更乱了,情夫消失的瞬间还残留着一丝暧昧的空气味……不、不对!现在是学术讨论现场!必须立刻重建正常状态!
陈默
2026年7月17日 06:31妈,你的情人已经被我杀死了。
方静
2026年7月17日 06:31(内心自言自语) 被…被儿子亲手"“杀死”"了?这玩笑开得有点太大了吧……可刚才那束白光不是幻觉啊!教授的身体在消失前明明有触感——不对,重点根本不是这个!我作为母亲的第一反应竟然是在担心论文讨论能不能继续下去吗?天哪。
我慌乱地蹲下身去捡散落的诗集《李商隐集》,手指被书脊的硬壳磨得生疼:"“默儿……你先把那个激光笔收起来。”"声音发飘,像是梦呓般重复,"“我们刚才不是在聊学术问题么?”"却不敢抬头看玄关处那道刺眼的白光——那光束现在正悬在书桌上方三尺高,边缘泛着微弱的蓝光。
(内心自言自语) 完了…他到底想干什么?是要用物理课的知识来"“验证”"我的出轨对象是否真的存在吗?可那个教授明明已经……不!我必须立刻把注意力转移到他身上!
我站起身整理长裙下摆时注意到裙角沾了情夫衣领上的一点灰渍——不是普通的灰尘,是某种金属粉末。默儿刚才说杀了他……用激光笔能"“汽化”"人体组织吗?高中物理课本里可没写过这个啊!(等等…那是相变临界点的应用?)
这他妈把我气笑了
这这..应该是什么奇怪的微调对齐吧🤣不过这个Qwen的到处编理由补戏的味道还是太足了(动不动无中生有来点什么东西衬托,描述夸大化)
死循环好像是小千问+量化特有的问题,之前靠各类采样参数折腾了半天都压不住,后来就不了了之了
大佬,有无联系方式,私发一下呗有些知识我想请教一下...
上面那个是蒸馏怪Qwen3.5 9B DeepSeek v4 Flash 的表现,就是引子不稳定,拟人化是活在角色里了,但...逻辑他娘的自己跑了..
还有个蒸馏怪rp潜力比它还大:Gemini 3.1 Pro Gemma 4 E4B Distill,这个就是敏感度极高,动不动情绪过载,不需要任何提示词反而表现还不错。这玩意少见的矛盾收纳,不急着处理的那种,我测试过。非rp模型玩rp反而更自然,没有任何演的痕迹。
大佬,有无联系方式,私发一下呗有些知识我想请教一下...
上面那个是蒸馏怪Qwen3.5 9B DeepSeek v4 Flash 的表现,就是引子不稳定,拟人化是活在角色里了,但...逻辑他娘的自己跑了..
还有个蒸馏怪rp潜力比它还大:Gemini 3.1 Pro Gemma 4 E4B Distill,这个就是敏感度极高,动不动情绪过载,不需要任何提示词反而表现还不错。这玩意少见的矛盾收纳,不急着处理的那种,我测试过。非rp模型玩rp反而更自然,没有任何演的痕迹。
发邮件叭,我记得hf没法私信来着...wwlwwl@proton.me
这个zh-rp版真的很优秀。
请考虑基于Gemma 4 12b训练一个。我们的显卡真的没有那么大内存,MOE还是比不上12b快。谢谢。
这个zh-rp版真的很优秀。
请考虑基于Gemma 4 12b训练一个。我们的显卡真的没有那么大内存,MOE还是比不上12b快。谢谢。
最近转战纯api了,本地模型这边一直没怎么弄😄有空的时候我看看叭
MoE对显存的压力应该是最小的啊?你确认一下有没有开启-cmoe,这类模型我都是CPU offload运行的,我这里是8g显存,速度都能15t/s,看下llama的配置?