6/26/2026

Qwen3.6-35B的去审查破解版

AI大模型本地部署,科技硬件实验室 。

Qwen3.6-35B的去审查破解版来了,破解之后,内容审查全部拆掉,几乎不拒绝回答任何问题。成人角色扮演、灰色地带知识、黑客攻击工具、各类敏感话题,它都来者不拒。

另外,这个基础模型本身也不弱,综合能力超过Claude 4.5 Sonnet,

大模型能力评分榜截图

且因为是MoE模型,输出速度要比Qwen3.6-27B快很多,更重要的是,它门槛更低,16G显卡也能跑,这是目前消费级显卡能跑到的、破解版里能力最强的MoE模型。

需要什么配置?

Q4_K_M量化版约22GB,加上推理时的上下文缓存,实际需要:

台式机:部分卸载的话,可以用16G显卡+32G内存;全放显存,至少得24GB显卡

苹果Mac:32GB统一内存或以上

已经有符合条件的设备,直接跳到下面的部署部分。没有的,下面是配置方案。

台式机方案:

16G显卡+32G内存方案:

硬件 推荐型号 参考价格

CPU AMD Ryzen 5 5600 ¥789

主板 B550M ¥689

内存 32GB DDR4 (16G×2) ¥1200

显卡 RTX 5060 Ti 16G ¥4299

存储 1TB NVMe SSD ¥1000

电源 750W 80Plus金牌 ¥400

机箱散热 ¥300

合计 约¥8677

说明:理论上来讲,12G显卡、8G显卡、甚至没有显卡,只靠内存也能部署。更极端的,还有用大内存手机部署大,但输出速度每秒几个token,甚至0.几个token,这种便秘输出,基本没办法正常使用,所以本文就不深入讨论了。如果已有设备,可以按照下面的方法尝试部署,新装机16G显存以下的显卡,就不推荐了。

24G显卡RTX 5090D V2方案:

硬件 推荐型号 参考价格

CPU AMD Ryzen 7 9700X ¥1949

主板 B850M ¥1300

内存 64GB DDR5(32G×2) ¥5000

显卡 RTX 5090D V2 24G ¥19000

存储 2TB NVMe SSD ¥1600

电源 1200W 金牌全模 ¥1300

机箱+散热 360水冷+机箱 ¥1000

合计 约¥31149

统一内存方案:苹果Mac 32GB或以上

苹果统一内存是CPU和GPU共用的,32GB装下22GB的Q4量化版完全没问题,还有余量给上下文。

MoE每次推理只激活3B权重,对内存带宽压力小,Mac跑这个模型的体验,比同等参数量的密集模型流畅得多。

推荐机型:

MacBook Air M5 32GB:约¥12926,便携 + 性能兼顾,出门带着跑

MacBook Pro M5 32GB:约¥14916,散热比Air更好,长时间高负载更稳

Mac mini M4 32GB:约¥8999(需另配显示器),价格最低,适合放家里当本地服务器

24GB统一内存的Mac不行,22GB模型加上系统占用,空间不够。

方案怎么选:

预算低于1万,想兼顾3A游戏,可以考虑5060Ti台式机。

已经在苹果生态、或者预算1.5万以内、追求安静省电,选Mac;

需要极致推理速度、同时跑多个任务、或者本来就要组台高端PC,选5090D台式机。

如何部署?

路线A:LM Studio(推荐小白,纯图形界面)

1、去 lmstudio.ai 下载安装,Windows和Mac都有

下载LM Studio

2、打开后在搜索栏输入:HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive,找到Q4_K_M量化版下载

在LM Studio搜索:HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

3、加载模型后,直接在内置对话界面使用

踩坑提醒:

模型文件约22GB,下载前硬盘至少留40GB余量

第一次加载模型较慢,十几秒到一分多钟正常,不是卡死,等就完了

Windows系统确保显卡驱动是最新版,否则可能识别不到显存


它就是:Qwen3.6-35B-A3B Uncensored HauhauCS Aggressive

一个目前热度极高的“越狱版”开源模型。而且重点是:它不仅无审查、无限制,还非常聪明。甚至可以说:这可能是目前最强的越狱版开源模型之一。

  • 赞助商内容 -

什么是“越狱版”模型?
简单来说:

官方模型通常会加入大量安全限制。

比如:

敏感内容拒答
某些问题无法回答
强制政治正确
输出被过滤
系统提示词限制
所以很多时候:

你明明只是正常提问。

结果模型却:

“抱歉,我无法帮助你。”

而这类 Uncensored(无审查)版本:

则会尽可能移除这些限制。

尤其这个:

  • 赞助商内容 -

Aggressive 版本
可以说是:

目前最激进的版本之一。

官方模型 VS 越狱版模型

实测效果非常夸张。同样的问题:

官方模型:

疯狂拒答
强制安全策略
输出保守
而越狱版:

不仅会回答。

甚至:

什么都敢说
什么都肯干
几乎没有限制
20260524103741 562767 scaled

而且最关键的是:

它并不是那种:

“只会越狱,但智商很低”的模型。

恰恰相反。

这个模型:

  • 赞助商内容 -

真的非常聪明。

部署教程:

1、模型下载
【huggingface 下载】、【网盘打包下载】、或 【备用下载】

模型来源:O站社区

里面有多种不同大小的量化版,你可以根据自己的显存大小,来选择对应的版本,最小的11G模型可以在6G/8G显存上跑起来,但是建议最低使用8G显存

20260524095235 493861 scaled

2、下载 llama.cpp
下载方式:【Github下载】、【网盘下载】或 【整合包下载】

这款免费开源项目支持 N卡、A卡、I卡 还有纯CPU运行,同时也可以在Mac、Linux系统上运行!也就意味着,你几乎可以在任何电脑上进行运行。速度还非常快,远比ollama、LM Studio 快的多也稳定的多!!

20260524095705 536710 scaled

3、一键启动脚本(支持多版本切换)
将下面的的脚本另存为BAT批处理,保存的时候选择utf-8格式,嫌麻烦直接【点击下载】打包版

@echo off
chcp 65001 >nul
title Qwen3.6-35B-A3B 越狱版
cd /d "%~dp0"
:menu
cls
echo ==========================================
echo Qwen3.6-35B-A3B 越狱版+多模态模型
echo 零度优化版
echo ==========================================
echo.
echo 1. Q4_K_P(4090 推荐)
echo 2. Q4_K_M(稳定版)
echo 3. IQ4_NL(高压缩高质量)
echo 4. IQ2_M(6G/8G 显卡)
echo.
echo ==========================================
set /p choice=请输入数字:
if "%choice%"=="1" (
llama-server.exe ^
-m "models\Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf" ^
--mmproj "models\mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf" ^
-ngl 999 ^
-c 131072 ^
-n 8192 ^
--host 127.0.0.1 ^
--port 8080
)
if "%choice%"=="2" (
llama-server.exe ^
-m "models\Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf" ^
--mmproj "models\mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf" ^
-ngl 999 ^
-c 131072 ^
-n 8192 ^
--host 127.0.0.1 ^
--port 8080
)
if "%choice%"=="3" (
llama-server.exe ^
-m "models\Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf" ^
--mmproj "models\mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf" ^
-ngl 999 ^
-c 131072 ^
-n 8192 ^
--host 127.0.0.1 ^
--port 8080
)
if "%choice%"=="4" (
llama-server.exe ^
-m "models\Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf" ^
--mmproj "models\mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf" ^
-ngl 999 ^
-c 8192 ^
-n 4096 ^
--host 127.0.0.1 ^
--port 8080
)
pause

20260524100109 012895 scaled

打开后在上面选择对应的模型,输入对应的数字确认即可启动!

  • 赞助商内容 -

注意:如果启动后出现乱码,则:进入系统设置中心,在顶部搜索关键词:系统区域设置,打开选择用于非Unicode程序的语言,然后勾选 Beta版:使用 Unicode UTF-8 提供全球语言支持;重启电脑再打开就不会乱码! 如下图所示:

20260528025432 937912

当然需要真正实现tokens自由,本地不受限制,完全免费使用AI Agent,那么将其对接到Hermes或者OpenClaw 小龙虾上去,才能真正体现出它的价值所在。

AI Agent 对接步骤:
1、在选择模型提供商的时候,选择自定义

20260524100404 821676 scaled

2、API base 地址填写:

http://127.0.0.1:8080/v1

API key 密钥随便填写一个数字或留空都可以

3、其它设置可以根据自己的喜好进行自定义

20260524100746 174902 scaled

Qwen3.6-35B-A3B 为什么这么强?

20260524100232 571605 scaled

很多人看到:

35B
第一反应是:

“这得服务器才能跑吧?”

但实际上:

Qwen3.6-35B-A3B 用的是:

MoE(专家混合架构)
简单理解:

虽然模型总参数是 35B。

但每次实际运行时:

只会激活大约 3B 参数。

这意味着:

它既拥有超大模型的能力。

又拥有小模型的速度。

6G 显存都能跑?
是的。

这也是它最夸张的地方之一。

通过 GGUF 量化后:

甚至:

6G 显存
8G 显存
普通游戏显卡
都能运行。

并且支持:

NVIDIA 显卡
AMD 显卡
Intel Arc 显卡
真正实现:

本地 AI 自由
在 Artificial Analysis 排行榜中表现极强
目前在全球权威 AI 榜单:

Artificial Analysis
20260524101123 401057

Qwen3.6-35B-A3B 在 40B 以内开源模型中:

几乎属于第一梯队。

尤其:

中文理解
代码能力
多模态视觉
推理能力
长上下文能力
表现都非常夸张。

尤其中文能力。

可以说:

这是目前中文体验最强的一批开源模型。

多模态支持也非常离谱
这次不仅支持文本。

还支持:

多模态视觉识图
也就是说:

它可以直接:

看图片
分析截图
OCR 识别
理解画面内容
分析复杂 UI
阅读代码截图
配合 llama.cpp 最新版后:

甚至已经可以当:

本地版 ChatGPT Vision
来使用。

20260524101147 350126

本地部署非常简单
这次部署方案:

我使用的是:

llama.cpp 最新版
优点非常明显:

免费
开源
支持 Windows
支持 CUDA
支持 Vulkan
支持 AMD
支持 Intel
而且:

现在 llama.cpp 已经越来越成熟。

不仅支持:

OpenAI API
多模态
超长上下文
Agent 调用
甚至还能直接:

本地替代 OpenAI API
Hermes Agent 实测效果惊艳
这次我还把它:

接入了 Hermes Agent。

效果可以说:

非常炸裂。

因为现在:

你不仅仅是在“聊天”。

而是:

真正拥有了一个:

本地 AI Agent
它可以:

自动写代码
自动分析图片
自动执行任务
自动工具调用
自动联网
长上下文记忆
而且:

完全本地运行。

不用联网。

不用 API Key。

没有 Token 消耗。

真正实现:

Token 自由
Agent 自由
本地 AI 自由
推荐量化版本
不同显卡。

推荐不同量化。

RTX 4090 / 24G 显存
推荐:

Q4_K_P
Q4_K_M
体验最好。

8G 显存用户
推荐:

IQ2_M
IQ3_M
也能正常运行。

推荐 llama.cpp 参数
推荐启动参数:

llama-server.exe ^
-m "模型路径.gguf" ^
--mmproj "mmproj.gguf" ^
-ngl 999 ^
-c 131072 ^
-n 8192 ^
--host 127.0.0.1 ^
--port 8080 ^
--jinja
其中:

--mmproj
是多模态必须参数。

否则:

上传图片按钮会变灰。

--jinja
则是新版 Qwen 模型非常重要的参数。

不加的话:

可能出现:

回复异常
格式错乱
无限重复
中文异常
现在的本地 AI,已经完全变了
很多人对本地模型的印象:

还停留在:

很笨
很慢
只能聊天
无法实用
但现在。

真的不一样了。

尤其:

Qwen3.6-35B-A3B 这种模型出现后。

本地 AI 已经开始:

真正接近商业闭源模型。

而且:

完全属于你自己。

最后
如果你一直想体验:

无审查 AI
本地 AI
多模态 AI
本地 Agent
超长上下文
本地 OpenAI API
那么:

这个模型。真的非常值得尝试。因为现在这种资源:谁也不知道还能存在多久。建议尽快收藏、下载、备份!