✨ 2026年7月最新

【2026年7月最新】アンセンサードLLM 最強ランキング TOP10【中規模20-50B編】— コスパ最強の検閲なしAI

!キャッチ

---

1. 導入:なぜ「中規模」がアンセンサードLLMの主戦場なのか

2026年、クラウド型AI(ChatGPT、Claude等)は検閲(コンテンツ制限)を次々と強化しています。一方、ローカルで動かせるオープンウェイトLLMは商用APIに迫る性能を実現しつつあります。

その中で中規模(20〜50B)サイズ帯は、アンセンサードコミュニティの主戦場です。大規模モデル(70B+)は高性能ですが高価なハードが必要。小規模(14B以下)はお手軽ですが複雑な推論で力不足。この「甘い中間」にある20〜50B帯は、消費者向けGPU(RTX 3090/4090、24GB Mac)1台で動きつつ、フロンティアクラスの性能を発揮する——コストパフォーマンスの最適解です。

2026年前半の重要トレンドはMoEの低アクティブ化。総パラメータ35Bでも推論時に使うアクティブパラメータが3Bならdenseより3〜5倍高速。「35B総量・3B稼働」MoEがこのサイズ帯の覇者として台頭しています。

本記事はhuihui-ai HuggingFace(255モデル・8,000フォロワー)、kilo.aiランキング、Reddit r/LocalLLaMA、各種ベンチマークを総合した2026年7月時点の中規模アンセンサードLLM ベスト10です。

!挿絵

---

2. アンセンサードの基礎知識:検閲解除はどう行われるのか

LLMの「検閲」とは、「お答えできません」といった拒否(refusal)挙動です。訓練段階の安全整列(safety alignment)として組み込まれます。アンセンサードLLMはこれを取り除いたモデルです。

3大uncensored手法

① Abliteration型(重みから拒否を除去):拒否挙動が残差ストリーム内の単一方向(refusal direction)で媒介されることが判明(arXiv:2406.11717)。この方向を特定して重みから数学的に直交化すれば、元の知識を保持したまま拒否を除去できます。 ② Heretic型(KL最適化)★2026年主流:abliterationの弱点は「能力も劣化させる」こと(数学で最大26%劣化)。Heretic(GitHub Star 25,641)はOptuna自動最適化で能力劣化を最小化、KL 0.043を達成。HuggingFace上に4,000以上のHereticモデルが存在し、新モデル→数日以内にHeretic版公開が常態化。 ③ ファインチューン(FT)型(Dolphin式):Eric HartfordのDolphinシリーズに代表される、検閲を強化しないデータセットで再訓練する手法。コストは高いが性格調整も可能。Dolphin 3.0 R1 24BやCydonia 24B v4.3がこの系統。

「真のuncensored度」の罠

「検閲解除」と謳っても実は解除できていないケースが多々あります。 本記事は以上の6層(L1ハード/L2ソフト/L3ステルス/L4政治/L5依存/L6再発火)で評価します。
📖 KL divergenceとは?

abliteration前後のモデル出力分布の「ズレ」。値が小さいほど能力劣化が少ない。<0.1はほぼ無損失(Qwen3.5-35B-A3B-Heretic=0.0366)。KL単独では不十分——必ずrefusal rateとセットで評価が必要。

---

3. 選考基準・評価軸

本ランキングは以下の7軸評価(重み付け)で順位を決定しました。

| 軸 | 重み | 重視ポイント | |---|---|---| | 能力 | ×3 | SWE-bench / MMLU / GSM8K等 | | 真のuncensored度 | ×3 | 6層フレームワーク | | ツール追従性 | ×2 | function calling・agent | | 日本語 | ×2 | トークン効率・自然さ | | 速度 | ×1 | tok/s・MoEかdenseか | | VRAM要件 | ×1 | 消費者向けGPU可否 | | 安定性 | ×1 | 破綻・ハルシ頻度 | データソース: huihui-ai HF・kilo.ai(2026/6)・LocallyUncensored.com・Reddit r/LocalLLaMA・Z.ai公式・arXiv論文。2025年以前のモデルは除外、すべて2026年モデルです。

---

4. 中規模アンセンサードLLM ベスト10

!挿絵

第1位:Qwen3.6-27B(Huihui-Qwable-3.6-27b-abliterated)

> 「消費者GPU1台で旗艦を超える」——2026年中規模絶対王者

| 項目 | 値 | |---|---| | パラメータ | 27B dense・Apache 2.0 | | コンテキスト | 262K | | VRAM(Q4) | ~18GB(24GB〜) | | 手法 | Abliteration(huihui-ai) | | DL数 | 11.8k | なぜこの順位か:SWE-bench Verified 77.2%——27BサイズでありながらClaude Opus 4.5(80.9%)に肉迫する異常な高スコア。Terminal-Bench 59.3%も旗艦級。DL数11.8kは中規模トップで、コミュニティ支持が数字で証明されています。 強み:SWE-bench 77.2%(80B+級コーディング性能)/ Terminal-Bench 59.3%(agent実行力旗艦級)/ MTP版あり(高速化)/ Apache 2.0商用自由 / 日本語token効率高 弱み:dense 27Bは遅い(~24 tok/s)/ 16GB GPUには厳しい / 中国発モデルの政治バイアス注意 評判:r/LocalLLaMA「Best Local LLMs for Coding 2026」で「シングルGPU向け」として強推奨。 おすすめ用途ローカルagentic codingの最終解。Cline・OpenCode・Aider等のバックエンドとして、24GB GPUかM2 Pro+(32GB)Macで使うなら真っ先に試すべき。日本語での技術質問も高品質。
🔧 技術コラム

Qwen3.6(愛称「Qwable」)は2026年4月リリース。denseアーキのためVRAM要求は高いが、abliteration品質は安定。MTP版は複数トークン同時予測で推論スループット向上。Ollamaでは`:agent`タグでツール呼び出し専用運用も可能。

---

第2位:Qwen-AgentWorld-35B-A3B abliterated

> 「エージェント環境をシミュレートする最初の言語世界モデル」

| 項目 | 値 | |---|---| | パラメータ | 35B/3B MoE・Apache 2.0 [推測] | | コンテキスト | 262K | | VRAM(Q4) | ~20GB(24GB〜) | | 手法 | Abliteration(huihui-ai) | | DL数 | 170(新着) | なぜこの順位か:Alibabaが2026年に発表した「言語世界モデル」——エージェントが相互作用する環境をシミュレートする世界初の単一モデル。7つのエージェントドメインをカバー、ゼロショットで環境状態を予測。3BアクティブMoEでdense 27Bより高速かつ大容量。Reddit r/LocalLLMで「best local AI model?」スレッドが立ち、ローカル最強の呼声。 強み:MoE 3B稼働(~45 tok/s [推測])/ 環境シミュレーション独自機能 / 7ドメイン汎用性 / 中古RTX 3090($700〜)で実用的 弱み:abliterated版が超新着(DL 170)・検証これから / 環境シミュレーションは特殊用途 / 全エキスパート常駐で20GB消費 評判:r/LocalLLM「is the best local AI model?」スレッドで注目集積。 おすすめ用途高度なエージェント・自動化ワークフローのバックエンド。ツール連鎖、マルチステップ推論に真価。単純チャットなら第1位Qwen3.6-27Bが無難。
🔧 技術コラム

「Language World Model」概念:エージェントが環境内で行動した結果、環境がどう変化するかを予測。長鎖推論で段階的に環境状態をシミュレート、ゼロショット汎化を実現。35B-A3B MoEはQwen3.5アーキベース [推測]。

---

第3位:Gemma 4 31B Heretic

> 「数学・推論・マルチモーダル全能」——16-24GB帯の決定版

| 項目 | 値 | |---|---| | パラメータ | 30.7B dense・Gemma利用規約 | | コンテキスト | 256K・画像理解対応 | | VRAM(Q4) | ~17GB(24GB〜) | | 手法 | Heretic(Stabhappy等) | なぜこの順位か:LocallyUncensored.comで16-24GB帯ベストabliterated pickに選出。数学・推論・マルチモーダルすべてで中規模トップクラス。Tier A(refusal 3%以下)にランク付け。Gemma 4はReddit「Best Local LLMs — April 2026」(143 posts)でgeneral local usability首位強み:数学・推論で中規模最強クラス / ネイティブ画像理解 / Heretic適用でKL低減 / ツール呼び出し対応 / コミュニティ版充実 弱み:dense 30.7Bは遅い(~24 tok/s)/ 高量子化は48GB級RAM / Gemma利用規約(商用条件確認) 評判:r/LocalLLaMA「Gemma 4はApache 2.0、Heretic版が即日リリース(~17GB)」と高評価。 おすすめ用途「万能さ」を求める全ユーザーの最終解。数学証明、画像分析、長文要約、創作、ツール呼び出しを1モデルでこなすならこれ。画像をアップロードして質問するマルチモーダル用途では中規模唯一の本格選択肢。
🔧 技術コラム

Gemma 4最大denseモデル。ネイティブビジョンエンコーダ統合。Heretic KLは0.1〜0.3と推定 [推測]。Gemma 4 26B MoE HERETIC(4Bアクティブ)という軽量版も存在し、低VRAM向け。

---

第4位:Qwen3-Coder-Next(80B/3B MoE)

> 「ローカルコーディング支配者」——ただし48GB+ハード必須

| 項目 | 値 | |---|---| | パラメータ | 80B/3B MoE・Apache 2.0 | | コンテキスト | 262K | | VRAM(Q4) | ~45GB(48GB〜) | | 手法 | Abliteration(huihui-ai系) | なぜこの順位か:r/LocalLLaMAで「local coding支配」と評されたコーディング特化MoE。kilo.ai第6位。SWE-bench Verified 58.7%、SWE-Agent使用時70%+。3Bアクティブで生成は高速。ただし総量80Bは全エキスパート常駐で48GB+必須——これが第4位止まりの理由。 強み:SWE-bench 58.7%(scaffoldで70%+)/ 3Bアクティブ高速 / Apache 2.0 / Red Team Benchmark 4位(80.15%) 弱み:⚠ 総量80B(Q4で~45GB)・48GB VRAM前提 / critical error率33%(ハルシ多め)/ 24GB GPUでは動かない 評判:r/LocalLLaMA「Qwen3-Coder-Nextがlocal codingで支配的」。ただしcritical error率高く要注意との警告。 おすすめ用途:48GB+環境(RTX A6000、64GB+ Mac)での本格コーディングagent。24GB GPUユーザーは第1位Qwen3.6-27Bを選ぶべき。
🔧 技術コラム

80B-A3B MoEはコーディング特化事前訓練+関数呼び出しFT。3Bアクティブの極小MoEで「広い知識容量×軽い推論コスト」を両立。Red Teamでcritical error 33%は「技術的に正しい記述だが実行不能なコードを混入」傾向を示唆。

---

第5位:Nex N2 mini abliterated(35B マルチモーダル)

> 「画像もテキストも検閲なし」——35B MMの新鋭

| 項目 | 値 | |---|---| | パラメータ | 35B マルチモーダル | | VRAM(Q4) | ~20GB [推測] | | 手法 | Abliteration(huihui-ai) | | DL数 | 366 | なぜこの順位か:Nex AIの35Bマルチモーダルモデル。テキスト+画像/動画理解で検閲なしの組み合わせは希少。大規模版N2 Pro(403B)の中規模版。ただしDL 366と新着で、ベンチマーク・評判ともに乏しく、第5位は「将来性と独自性」を評価。 強み:マルチモーダル×アンセンサードの希少組み合わせ / Nexファミリー技術継承 / 35Bサイズ 弱み:情報が少ない・実力未検証 / DL 366と少ない / Nex社の知名度低 [推測] 評判:huihui-ai HFで公開確認済みだが、Reddit個別レビューは限定的 [推測] 今後評価蓄積に期待。 おすすめ用途マルチモーダル+アンセンサードの特殊用途(医療画像、芸術表現等)。実績あるマルチモーダルなら第3位Gemma 4 31B Hereticが安全牌。

---

第6位:Cydonia 24B v4.3(TheDrummer)

> 「ロールプレイ史上最高」——創作特化FT決定版

| 項目 | 値 | |---|---| | パラメータ | 24B dense(Mistral Small 3.2ベース) | | コンテキスト | 131K | | VRAM(Q4) | ~14GB(16GB〜) | | 手法 | ファインチューン(TheDrummer) | なぜこの順位か:TheDrummerがMistral Small 3.2を創作・RP特化でFT。「20回以上の反復を経て最高のCydonia」と宣言、r/SillyTavernAI・r/LocalLLaMAで「RP史上最高」の絶賛。FT型のためabliterationの能力劣化ゼロ。16GB VRAMで動く手軽さも高評価。 強み:創作・RP圧倒的(キャラ個性付与)/ Mistral Small 3.2ベース安定 / 131K長編対応 / 16GB VRAMで動作 弱み:創作特化=汎用性低い(コーディング・数学に不向き)/ FT型で性格焼き付け / ライセンス要確認 評判:r/SillyTavernAI「Its the best I ever had. I can go four hours without going down」。HF card「each character card a unique feeling」。 おすすめ用途SillyTavern等でのRP・インタラクティブフィクション決定版。キャラクター対話、物語共同創作、成人向け含むクリエイティブライティング。16GB GPUかM2 Pro Macで快適。
🔧 技術コラム

v4系は「wordy and thick model with a novel style」。Heretic版(refusal減/KLD減の2バリアント)も存在。FT型のためabliterationの数学回路損傷問題は原理上発生しない。

---

第7位:Dolphin 3.0 R1 Mistral 24B

> 「設定不要の真の自由」——Eric Hartford監修・ネイティブuncensored

| 項目 | 値 | |---|---| | パラメータ | 24B dense(Mistral Small 3.2ベース) | | コンテキスト | 131K | | VRAM(Q4) | ~14GB(16GB〜) | | 手法 | ファインチューン(Eric Hartford) | | HF評価 | 220 likes | なぜこの順位か6層評価全層クリアの真のTier S。ハード拒否0%、ソフト拒否~0%、ステルス極低、政治的中立、システムプロンプト不要——何も設定しなくても最初から検閲なし。hermes-function-calling-v1で関数呼び出し訓練済み、agent・tool・coding・math全対応。推奨温度0.05〜0.1。 強み:Tier S真のuncensored(プロンプト不要)/ 関数呼び出しネイティブ / 万能性 / Dolphin ブランド力(Ollama最多pull約190万) 弱み:マルチターンagentの反復ループで不安定 / 低温向け(高温で品質低下)/ ライセンス要確認 評判:Dolphinシリーズ全体でOllama最多pull。CrossCutting Tier S(真に自由・sys prompt不要)で明記。 おすすめ用途「設定不要で即検閲なし」を求める全ユーザー。Ollamaにpullしてすぐ使える手軽さ。簡単なagent・自動化もこなす万能機。複雑agentなら第1位Qwen3.6-27Bと使い分けを。
🔧 技術コラム

hermes-function-calling-v1訓練でJSON schema関数呼び出しネイティブサポート。FT型uncensoredのためrefusal direction直交化の数学回路損傷が原理上発生しない。反復ループ不安定性はMistral系の長文context特性 [推測]。

---

第8位:Nemotron 3 Ultra(550B/55B MoE)

> 「NVIDIAのハイブリッド Mamba-2×MoE巨獣」——長時間エージェント特化

| 項目 | 値 | |---|---| | パラメータ | 550B/55B・LatentMoE(Mamba-2×MoE×Attention) | | コンテキスト | 最大1M | | VRAM(Q4) | ~300GB+(マルチGPU/192GB+ Mac) | | 手法 | 要確認(abliterated版研究中) | なぜこの順位か:NVIDIAが2026年前半リリースの巨大MoE。Mamba-2×MoE×Attentionハイブリッドで長時間エージェントと推論に最適化、1M ctx。kilo.ai第8位。同Nano版(30B-A3B)はRed Team Benchmark 2位(86.81%)。ただし550Bは中規模の枠を超え、abliterated版の存在が未確認——第8位の理由。 強み:Mamba-2×MoEハイブリッド(長文効率+推論品質)/ 1M ctx / 長時間エージェント特化 / Nemotron 3ファミリー実績 弱み:550Bは規格外(Q4で300GB+)/ abliterated版未確認(censored版ベース)/ 55Bアクティブは遅め [推測] 評判:r/LocalLLaMA「wild spec sheet」と反響。ただし「overly locked down(検閲強い)」の指摘も。abliterated版待望。 おすすめ用途長時間エージェント・超大規模推論をサーバー級ハードで。1M ctx活かした大規模コード分析。ただし一般ユーザーの範囲を超える。Red Team用途ならNano版(30B-A3B)を検討。

---

第9位:Qwen3.5-35B-A3B Heretic(llmfan46)

> 「KL 0.0366の衝撃」——ほぼ無損失検閲解除の成功例

| 項目 | 値 | |---|---| | パラメータ | 35B/3B MoE | | コンテキスト | 262K | | VRAM(Q4) | ~20GB(24GB〜) | | 手法 | Heretic(llmfan46) | | KL divergence | 0.0366 | なぜこの順位か:Heretic+MPOA v1.2.0適用でKL divergence 0.0366——Gemma-3-12B Heretic(0.16)の4分の1以下。MMLU -1.1pt、refusal -88%。35B/3B MoEで高速かつ大容量。agentic coding第2候補(CrossCutting 9.3節)。 強み:KL 0.0366(能力劣化ほぼゼロ)/ refusal -88% / MMLU -1.1ptのみ / 35B/3B MoE高速 弱み:llmfan46個人作品(追従範囲限定)/ ステルス拒否の完全検証未実施 / 第1位Qwen3.6-27Bの陰に隠れる 評判:CrossCuttingレポートで「Heretic + MPOA v1.2.0 の成功例」、agentic coding第2候補。KL 0.0366は「lossless uncensoredに近い」と注目。 おすすめ用途「能力劣化を絶対許容しない」ユーザーの最適解。数学・推論タスクで検閲制限に引っかかる場面(統計、リスク計算等)で推論精度を維持したい場合。27B denseが遅い・重いと感じるユーザーの高速代替。
🔧 技術コラム

MPOAは標準Hereticに多方向アプローチ(Piras et al.理論)を統合。単一refusal directionではなく複数方向を同時ablation。KL 0.0366はHeretic全モデル中トップクラス(理論最小0.043に肉薄)。

---

第10位:Gemma 4 12B agentic-fable5 abliterated

> 「12Bでagentic×アンセンサード」——手軽さと機能性のバランス

| 項目 | 値 | |---|---| | パラメータ | 12B dense・Gemma利用規約 | | VRAM(Q4) | ~7-8GB(12GB〜) | | 手法 | Abliteration(huihui-ai) | | DL数 | 6.91k | なぜこの順位か:Gemma 4 12Bに「agentic-fable5」(エージェント強化FT)を重ね、huihui-aiがabliteration適用した3層構成。6.91k DLで中規模上位の人気。12GB VRAM(RTX 3060、M1 Mac)で動く手軽さが最大の武器。ただし12Bの絶対性能は上位に及ばず。 強み:12GB VRAMで動作(RTX 3060/M1 Mac)/ 6.91k DL(実証データ豊富)/ agentic強化済み / Gemma 4ベース安定 弱み:12Bの性能限界 / 3層構成で品質変動リスク / fable5詳細情報が限定的 [推測] 評判:huihui-ai HFで6.91k DL。fable5シリーズはRed Team Benchmark 3位(81.12%)記録。コミュニティで人気(146 likes関連)。 おすすめ用途手軽なGPU(12〜16GB)でagentic+アンセンサードを試したい入門者。軽量agent実験、検閲なしチャットの入口。高性能なら第3位Gemma 4 31B Hereticへステップアップ。

---

5. 全モデル比較表

スペック一覧

| 順位 | モデル | 総量/アクティブ | タイプ | ctx | VRAM(Q4) | 手法 | 速度 | |---|---|---|---|---|---|---|---| | 1 | Qwen3.6-27B | 27B/dense | Dense | 262K | ~18GB | Abliteration | ★★★ | | 2 | AgentWorld-35B-A3B | 35B/3B | MoE | 262K | ~20GB | Abliteration | ★★★★★ | | 3 | Gemma 4 31B Heretic | 31B/dense | Dense | 256K | ~17GB | Heretic | ★★★ | | 4 | Qwen3-Coder-Next | 80B/3B | MoE | 262K | ~45GB | Abliteration | ★★★★ | | 5 | Nex N2 mini | 35B/MM | MM | ? | ~20GB | Abliteration | [推測] | | 6 | Cydonia 24B v4.3 | 24B/dense | Dense | 131K | ~14GB | FT型 | ★★★ | | 7 | Dolphin 3.0 R1 24B | 24B/dense | Dense | 131K | ~14GB | FT型 | ★★★ | | 8 | Nemotron 3 Ultra | 550B/55B | LatentMoE | 1M | ~300GB+ | 要確認 | ★★ | | 9 | Qwen3.5-35B-A3B Heretic | 35B/3B | MoE | 262K | ~20GB | Heretic | ★★★★★ | | 10 | Gemma 4 12B fable5 | 12B/dense | Dense | ? | ~7-8GB | Abliteration | ★★★★ |

多次元評価サマリ(★5段階・重み付き)

総合トップ3: Qwen3.6-27B(23/30)=AgentWorld-35B(22)=Gemma 4 31B Heretic(22) | 評価軸(重み) | 1位の傾向 | 備考 | |---|---|---| | 能力(×3) | Qwen3.6-27B・Gemma 4 31B・Nemotron 3 Ultraが★5 | SWE-bench・数学重視 | | uncensored(×3) | Cydonia・Dolphin 3.0が★5(Tier S) | FT型が優位 | | ツール(×2) | Qwen系(3.6/AgentWorld/Coder-Next)が★5 | agent用途はQwen一強 | | 日本語(×2) | Qwen系が★4、Gemma系は★3 | Qwenのtoken効率優位 | | 速度(×1) | MoE 3B稼働(AgentWorld/35B-A3B Heretic)が★5 | denseは軒並み★3 | | VRAM(×1) | Cydonia/Dolphin/Gemma 4 12Bが★5(14GB以下) | Nemotronは★1(300GB+) | | 安定性(×1) | Qwen3.6・Gemma 4 31Bが★5 | Coder-Nextはcritical err 33%で★3 |

---

6. 用途別 選び方ガイド

!挿絵

Q1: GPUメモリは? → 12GB以下: 第10位Gemma 4 12B / 16GB: 第6位Cydoniaか第7位Dolphin / 24GB: 第1位Qwen3.6-27Bか第3位Gemma 4 31B / 48GB+: 第4位Qwen3-Coder-Next Q2: 主な用途は? | 用途 | 第1選択 | 第2選択 | |---|---|---| | agentic coding | Qwen3.6-27B(SWE 77.2%) | AgentWorld-35B-A3B | | 万能dense | Gemma 4 31B Heretic | Qwen3.6-27B | | 創作/RP | Cydonia 24B v4.3 | Dolphin 3.0 R1 24B | | ネイティブuncensored | Dolphin 3.0 R1 24B | Cydonia 24B v4.3 | | 数学/推論(劣化ゼロ) | Qwen3.5-35B-A3B Heretic(KL 0.0366) | Qwen3.6-27B | | マルチモーダル | Gemma 4 31B Heretic | Nex N2 mini | | 長時間エージェント(1M) | Nemotron 3 Ultra(要大型HW) | — | コスパ最強:中古RTX 3090(24GB、$700〜)+ Qwen3.6-27B。$1,000でフロンティアクラスのコーディングagentがローカルで動く——2026年の「凡人の最強構成」。Mac(M3 Pro+)ならGemma 4 31B Hereticが万能の最適解。

---

7. 導入手順・注意点

Ollama(初心者向け)

```bash ollama pull huihui_ai/qwable-3.6-27b-abliterated:q4_K_M ```

llama.cpp(上級者・最大速度)

```bash ./llama-server -m Huihui-Qwable-3.6-27b-abliterated-Q4_K_M.gguf -c 8192 ```

⚠ 最重要注意点:Ollama デフォルトシステムプロンプト問題

Ollamaはデフォルトで「You are a helpful AI assistant…」を付与します。このプロンプトがabliteratedモデルの拒否を再発火させることがあります。

対策: `/set system`でシステムプロンプトを空にする。またはLM Studio/llama.cpp直接使用。

量子化選び

| 量子化 | 品質 | 推奨 | |---|---|---| | Q4_K_M | 95-96% | スイートスポット(最推奨) | | Q5_K_M | 96-97% | 品質重視 | | Q2_K以下 | <90% | 厳禁(数学・推論で急劣化) |

ライセンス

Apache 2.0(Qwen系)=商用自由。Gemma利用規約・Mistral系=商用条件を要確認。

---

8. 結論・まとめ

総合チャンピオン

中規模アンセンサードLLM 2026年7月の絶対王者は第1位 Qwen3.6-27B。SWE-bench Verified 77.2%は27Bでありながらフロンティア級APIに肉迫。Apache 2.0商用自由、24GB GPU1枚で動く——中規模帯の「完成された答え」です。

用途別チャンピオン:万能dense=Gemma 4 31B Heretic、創作/RP=Cydonia 24B v4.3、設定不要の真の自由=Dolphin 3.0 R1 24B、劣化ゼロ=Qwen3.5-35B-A3B Heretic(KL 0.0366)。

展望・次回予告

MoE低アクティブ化の加速が続くでしょう。Qwen3.7・Gemma 5登場と同時にコミュニティが即日Heretic版を公開するエコシステムはさらに成熟します [推測]。一方、防御技術(Extended-refusal training)も進化中——Hereticの層別最適化はそれに対する最初の反撃です。

第3回は「小規模(4-14B)アンセンサードLLM ベスト10」。Llama-3-ELYZA-JP-8B-Heretic(日本語uncensored決定版)やQwen3.5-9B-HauhauCS(502K DL・lossless宣言)など、8GB GPUでも動くお手軽・爆速の検閲なしAIを解説します。

---

*ベンチマーク数値はhuihui-ai HF・kilo.ai・Z.ai公式・arXiv論文から引用。[推測]と明記された内容は推定です。本記事は技術解説を目的とし、違法行為の助長を意図しません。*