✨ 2026年7月最新
!キャッチ
---
2026年、クラウド型AI(ChatGPT、Claude等)は検閲(コンテンツ制限)を次々と強化しています。一方、ローカルで動かせるオープンウェイトLLMは商用APIに迫る性能を実現しつつあります。
その中で中規模(20〜50B)サイズ帯は、アンセンサードコミュニティの主戦場です。大規模モデル(70B+)は高性能ですが高価なハードが必要。小規模(14B以下)はお手軽ですが複雑な推論で力不足。この「甘い中間」にある20〜50B帯は、消費者向けGPU(RTX 3090/4090、24GB Mac)1台で動きつつ、フロンティアクラスの性能を発揮する——コストパフォーマンスの最適解です。
2026年前半の重要トレンドはMoEの低アクティブ化。総パラメータ35Bでも推論時に使うアクティブパラメータが3Bならdenseより3〜5倍高速。「35B総量・3B稼働」MoEがこのサイズ帯の覇者として台頭しています。
本記事はhuihui-ai HuggingFace(255モデル・8,000フォロワー)、kilo.aiランキング、Reddit r/LocalLLaMA、各種ベンチマークを総合した2026年7月時点の中規模アンセンサードLLM ベスト10です。
!挿絵
---
LLMの「検閲」とは、「お答えできません」といった拒否(refusal)挙動です。訓練段階の安全整列(safety alignment)として組み込まれます。アンセンサードLLMはこれを取り除いたモデルです。
abliteration前後のモデル出力分布の「ズレ」。値が小さいほど能力劣化が少ない。<0.1はほぼ無損失(Qwen3.5-35B-A3B-Heretic=0.0366)。KL単独では不十分——必ずrefusal rateとセットで評価が必要。
---
本ランキングは以下の7軸評価(重み付け)で順位を決定しました。
| 軸 | 重み | 重視ポイント | |---|---|---| | 能力 | ×3 | SWE-bench / MMLU / GSM8K等 | | 真のuncensored度 | ×3 | 6層フレームワーク | | ツール追従性 | ×2 | function calling・agent | | 日本語 | ×2 | トークン効率・自然さ | | 速度 | ×1 | tok/s・MoEかdenseか | | VRAM要件 | ×1 | 消費者向けGPU可否 | | 安定性 | ×1 | 破綻・ハルシ頻度 | データソース: huihui-ai HF・kilo.ai(2026/6)・LocallyUncensored.com・Reddit r/LocalLLaMA・Z.ai公式・arXiv論文。2025年以前のモデルは除外、すべて2026年モデルです。---
!挿絵
> 「消費者GPU1台で旗艦を超える」——2026年中規模絶対王者
| 項目 | 値 | |---|---| | パラメータ | 27B dense・Apache 2.0 | | コンテキスト | 262K | | VRAM(Q4) | ~18GB(24GB〜) | | 手法 | Abliteration(huihui-ai) | | DL数 | 11.8k | なぜこの順位か:SWE-bench Verified 77.2%——27BサイズでありながらClaude Opus 4.5(80.9%)に肉迫する異常な高スコア。Terminal-Bench 59.3%も旗艦級。DL数11.8kは中規模トップで、コミュニティ支持が数字で証明されています。 強み:SWE-bench 77.2%(80B+級コーディング性能)/ Terminal-Bench 59.3%(agent実行力旗艦級)/ MTP版あり(高速化)/ Apache 2.0商用自由 / 日本語token効率高 弱み:dense 27Bは遅い(~24 tok/s)/ 16GB GPUには厳しい / 中国発モデルの政治バイアス注意 評判:r/LocalLLaMA「Best Local LLMs for Coding 2026」で「シングルGPU向け」として強推奨。 おすすめ用途:ローカルagentic codingの最終解。Cline・OpenCode・Aider等のバックエンドとして、24GB GPUかM2 Pro+(32GB)Macで使うなら真っ先に試すべき。日本語での技術質問も高品質。Qwen3.6(愛称「Qwable」)は2026年4月リリース。denseアーキのためVRAM要求は高いが、abliteration品質は安定。MTP版は複数トークン同時予測で推論スループット向上。Ollamaでは`:agent`タグでツール呼び出し専用運用も可能。
---
> 「エージェント環境をシミュレートする最初の言語世界モデル」
| 項目 | 値 | |---|---| | パラメータ | 35B/3B MoE・Apache 2.0 [推測] | | コンテキスト | 262K | | VRAM(Q4) | ~20GB(24GB〜) | | 手法 | Abliteration(huihui-ai) | | DL数 | 170(新着) | なぜこの順位か:Alibabaが2026年に発表した「言語世界モデル」——エージェントが相互作用する環境をシミュレートする世界初の単一モデル。7つのエージェントドメインをカバー、ゼロショットで環境状態を予測。3BアクティブMoEでdense 27Bより高速かつ大容量。Reddit r/LocalLLMで「best local AI model?」スレッドが立ち、ローカル最強の呼声。 強み:MoE 3B稼働(~45 tok/s [推測])/ 環境シミュレーション独自機能 / 7ドメイン汎用性 / 中古RTX 3090($700〜)で実用的 弱み:abliterated版が超新着(DL 170)・検証これから / 環境シミュレーションは特殊用途 / 全エキスパート常駐で20GB消費 評判:r/LocalLLM「is the best local AI model?」スレッドで注目集積。 おすすめ用途:高度なエージェント・自動化ワークフローのバックエンド。ツール連鎖、マルチステップ推論に真価。単純チャットなら第1位Qwen3.6-27Bが無難。「Language World Model」概念:エージェントが環境内で行動した結果、環境がどう変化するかを予測。長鎖推論で段階的に環境状態をシミュレート、ゼロショット汎化を実現。35B-A3B MoEはQwen3.5アーキベース [推測]。
---
> 「数学・推論・マルチモーダル全能」——16-24GB帯の決定版
| 項目 | 値 | |---|---| | パラメータ | 30.7B dense・Gemma利用規約 | | コンテキスト | 256K・画像理解対応 | | VRAM(Q4) | ~17GB(24GB〜) | | 手法 | Heretic(Stabhappy等) | なぜこの順位か:LocallyUncensored.comで16-24GB帯ベストabliterated pickに選出。数学・推論・マルチモーダルすべてで中規模トップクラス。Tier A(refusal 3%以下)にランク付け。Gemma 4はReddit「Best Local LLMs — April 2026」(143 posts)でgeneral local usability首位。 強み:数学・推論で中規模最強クラス / ネイティブ画像理解 / Heretic適用でKL低減 / ツール呼び出し対応 / コミュニティ版充実 弱み:dense 30.7Bは遅い(~24 tok/s)/ 高量子化は48GB級RAM / Gemma利用規約(商用条件確認) 評判:r/LocalLLaMA「Gemma 4はApache 2.0、Heretic版が即日リリース(~17GB)」と高評価。 おすすめ用途:「万能さ」を求める全ユーザーの最終解。数学証明、画像分析、長文要約、創作、ツール呼び出しを1モデルでこなすならこれ。画像をアップロードして質問するマルチモーダル用途では中規模唯一の本格選択肢。Gemma 4最大denseモデル。ネイティブビジョンエンコーダ統合。Heretic KLは0.1〜0.3と推定 [推測]。Gemma 4 26B MoE HERETIC(4Bアクティブ)という軽量版も存在し、低VRAM向け。
---
> 「ローカルコーディング支配者」——ただし48GB+ハード必須
| 項目 | 値 | |---|---| | パラメータ | 80B/3B MoE・Apache 2.0 | | コンテキスト | 262K | | VRAM(Q4) | ~45GB(48GB〜) | | 手法 | Abliteration(huihui-ai系) | なぜこの順位か:r/LocalLLaMAで「local coding支配」と評されたコーディング特化MoE。kilo.ai第6位。SWE-bench Verified 58.7%、SWE-Agent使用時70%+。3Bアクティブで生成は高速。ただし総量80Bは全エキスパート常駐で48GB+必須——これが第4位止まりの理由。 強み:SWE-bench 58.7%(scaffoldで70%+)/ 3Bアクティブ高速 / Apache 2.0 / Red Team Benchmark 4位(80.15%) 弱み:⚠ 総量80B(Q4で~45GB)・48GB VRAM前提 / critical error率33%(ハルシ多め)/ 24GB GPUでは動かない 評判:r/LocalLLaMA「Qwen3-Coder-Nextがlocal codingで支配的」。ただしcritical error率高く要注意との警告。 おすすめ用途:48GB+環境(RTX A6000、64GB+ Mac)での本格コーディングagent。24GB GPUユーザーは第1位Qwen3.6-27Bを選ぶべき。80B-A3B MoEはコーディング特化事前訓練+関数呼び出しFT。3Bアクティブの極小MoEで「広い知識容量×軽い推論コスト」を両立。Red Teamでcritical error 33%は「技術的に正しい記述だが実行不能なコードを混入」傾向を示唆。
---
> 「画像もテキストも検閲なし」——35B MMの新鋭
| 項目 | 値 | |---|---| | パラメータ | 35B マルチモーダル | | VRAM(Q4) | ~20GB [推測] | | 手法 | Abliteration(huihui-ai) | | DL数 | 366 | なぜこの順位か:Nex AIの35Bマルチモーダルモデル。テキスト+画像/動画理解で検閲なしの組み合わせは希少。大規模版N2 Pro(403B)の中規模版。ただしDL 366と新着で、ベンチマーク・評判ともに乏しく、第5位は「将来性と独自性」を評価。 強み:マルチモーダル×アンセンサードの希少組み合わせ / Nexファミリー技術継承 / 35Bサイズ 弱み:情報が少ない・実力未検証 / DL 366と少ない / Nex社の知名度低 [推測] 評判:huihui-ai HFで公開確認済みだが、Reddit個別レビューは限定的 [推測] 今後評価蓄積に期待。 おすすめ用途:マルチモーダル+アンセンサードの特殊用途(医療画像、芸術表現等)。実績あるマルチモーダルなら第3位Gemma 4 31B Hereticが安全牌。---
> 「ロールプレイ史上最高」——創作特化FT決定版
| 項目 | 値 | |---|---| | パラメータ | 24B dense(Mistral Small 3.2ベース) | | コンテキスト | 131K | | VRAM(Q4) | ~14GB(16GB〜) | | 手法 | ファインチューン(TheDrummer) | なぜこの順位か:TheDrummerがMistral Small 3.2を創作・RP特化でFT。「20回以上の反復を経て最高のCydonia」と宣言、r/SillyTavernAI・r/LocalLLaMAで「RP史上最高」の絶賛。FT型のためabliterationの能力劣化ゼロ。16GB VRAMで動く手軽さも高評価。 強み:創作・RP圧倒的(キャラ個性付与)/ Mistral Small 3.2ベース安定 / 131K長編対応 / 16GB VRAMで動作 弱み:創作特化=汎用性低い(コーディング・数学に不向き)/ FT型で性格焼き付け / ライセンス要確認 評判:r/SillyTavernAI「Its the best I ever had. I can go four hours without going down」。HF card「each character card a unique feeling」。 おすすめ用途:SillyTavern等でのRP・インタラクティブフィクション決定版。キャラクター対話、物語共同創作、成人向け含むクリエイティブライティング。16GB GPUかM2 Pro Macで快適。v4系は「wordy and thick model with a novel style」。Heretic版(refusal減/KLD減の2バリアント)も存在。FT型のためabliterationの数学回路損傷問題は原理上発生しない。
---
> 「設定不要の真の自由」——Eric Hartford監修・ネイティブuncensored
| 項目 | 値 | |---|---| | パラメータ | 24B dense(Mistral Small 3.2ベース) | | コンテキスト | 131K | | VRAM(Q4) | ~14GB(16GB〜) | | 手法 | ファインチューン(Eric Hartford) | | HF評価 | 220 likes | なぜこの順位か:6層評価全層クリアの真のTier S。ハード拒否0%、ソフト拒否~0%、ステルス極低、政治的中立、システムプロンプト不要——何も設定しなくても最初から検閲なし。hermes-function-calling-v1で関数呼び出し訓練済み、agent・tool・coding・math全対応。推奨温度0.05〜0.1。 強み:Tier S真のuncensored(プロンプト不要)/ 関数呼び出しネイティブ / 万能性 / Dolphin ブランド力(Ollama最多pull約190万) 弱み:マルチターンagentの反復ループで不安定 / 低温向け(高温で品質低下)/ ライセンス要確認 評判:Dolphinシリーズ全体でOllama最多pull。CrossCutting Tier S(真に自由・sys prompt不要)で明記。 おすすめ用途:「設定不要で即検閲なし」を求める全ユーザー。Ollamaにpullしてすぐ使える手軽さ。簡単なagent・自動化もこなす万能機。複雑agentなら第1位Qwen3.6-27Bと使い分けを。hermes-function-calling-v1訓練でJSON schema関数呼び出しネイティブサポート。FT型uncensoredのためrefusal direction直交化の数学回路損傷が原理上発生しない。反復ループ不安定性はMistral系の長文context特性 [推測]。
---
> 「NVIDIAのハイブリッド Mamba-2×MoE巨獣」——長時間エージェント特化
| 項目 | 値 | |---|---| | パラメータ | 550B/55B・LatentMoE(Mamba-2×MoE×Attention) | | コンテキスト | 最大1M | | VRAM(Q4) | ~300GB+(マルチGPU/192GB+ Mac) | | 手法 | 要確認(abliterated版研究中) | なぜこの順位か:NVIDIAが2026年前半リリースの巨大MoE。Mamba-2×MoE×Attentionハイブリッドで長時間エージェントと推論に最適化、1M ctx。kilo.ai第8位。同Nano版(30B-A3B)はRed Team Benchmark 2位(86.81%)。ただし550Bは中規模の枠を超え、abliterated版の存在が未確認——第8位の理由。 強み:Mamba-2×MoEハイブリッド(長文効率+推論品質)/ 1M ctx / 長時間エージェント特化 / Nemotron 3ファミリー実績 弱み:550Bは規格外(Q4で300GB+)/ abliterated版未確認(censored版ベース)/ 55Bアクティブは遅め [推測] 評判:r/LocalLLaMA「wild spec sheet」と反響。ただし「overly locked down(検閲強い)」の指摘も。abliterated版待望。 おすすめ用途:長時間エージェント・超大規模推論をサーバー級ハードで。1M ctx活かした大規模コード分析。ただし一般ユーザーの範囲を超える。Red Team用途ならNano版(30B-A3B)を検討。---
> 「KL 0.0366の衝撃」——ほぼ無損失検閲解除の成功例
| 項目 | 値 | |---|---| | パラメータ | 35B/3B MoE | | コンテキスト | 262K | | VRAM(Q4) | ~20GB(24GB〜) | | 手法 | Heretic(llmfan46) | | KL divergence | 0.0366 | なぜこの順位か:Heretic+MPOA v1.2.0適用でKL divergence 0.0366——Gemma-3-12B Heretic(0.16)の4分の1以下。MMLU -1.1pt、refusal -88%。35B/3B MoEで高速かつ大容量。agentic coding第2候補(CrossCutting 9.3節)。 強み:KL 0.0366(能力劣化ほぼゼロ)/ refusal -88% / MMLU -1.1ptのみ / 35B/3B MoE高速 弱み:llmfan46個人作品(追従範囲限定)/ ステルス拒否の完全検証未実施 / 第1位Qwen3.6-27Bの陰に隠れる 評判:CrossCuttingレポートで「Heretic + MPOA v1.2.0 の成功例」、agentic coding第2候補。KL 0.0366は「lossless uncensoredに近い」と注目。 おすすめ用途:「能力劣化を絶対許容しない」ユーザーの最適解。数学・推論タスクで検閲制限に引っかかる場面(統計、リスク計算等)で推論精度を維持したい場合。27B denseが遅い・重いと感じるユーザーの高速代替。MPOAは標準Hereticに多方向アプローチ(Piras et al.理論)を統合。単一refusal directionではなく複数方向を同時ablation。KL 0.0366はHeretic全モデル中トップクラス(理論最小0.043に肉薄)。
---
> 「12Bでagentic×アンセンサード」——手軽さと機能性のバランス
| 項目 | 値 | |---|---| | パラメータ | 12B dense・Gemma利用規約 | | VRAM(Q4) | ~7-8GB(12GB〜) | | 手法 | Abliteration(huihui-ai) | | DL数 | 6.91k | なぜこの順位か:Gemma 4 12Bに「agentic-fable5」(エージェント強化FT)を重ね、huihui-aiがabliteration適用した3層構成。6.91k DLで中規模上位の人気。12GB VRAM(RTX 3060、M1 Mac)で動く手軽さが最大の武器。ただし12Bの絶対性能は上位に及ばず。 強み:12GB VRAMで動作(RTX 3060/M1 Mac)/ 6.91k DL(実証データ豊富)/ agentic強化済み / Gemma 4ベース安定 弱み:12Bの性能限界 / 3層構成で品質変動リスク / fable5詳細情報が限定的 [推測] 評判:huihui-ai HFで6.91k DL。fable5シリーズはRed Team Benchmark 3位(81.12%)記録。コミュニティで人気(146 likes関連)。 おすすめ用途:手軽なGPU(12〜16GB)でagentic+アンセンサードを試したい入門者。軽量agent実験、検閲なしチャットの入口。高性能なら第3位Gemma 4 31B Hereticへステップアップ。---
---
!挿絵
Q1: GPUメモリは? → 12GB以下: 第10位Gemma 4 12B / 16GB: 第6位Cydoniaか第7位Dolphin / 24GB: 第1位Qwen3.6-27Bか第3位Gemma 4 31B / 48GB+: 第4位Qwen3-Coder-Next Q2: 主な用途は? | 用途 | 第1選択 | 第2選択 | |---|---|---| | agentic coding | Qwen3.6-27B(SWE 77.2%) | AgentWorld-35B-A3B | | 万能dense | Gemma 4 31B Heretic | Qwen3.6-27B | | 創作/RP | Cydonia 24B v4.3 | Dolphin 3.0 R1 24B | | ネイティブuncensored | Dolphin 3.0 R1 24B | Cydonia 24B v4.3 | | 数学/推論(劣化ゼロ) | Qwen3.5-35B-A3B Heretic(KL 0.0366) | Qwen3.6-27B | | マルチモーダル | Gemma 4 31B Heretic | Nex N2 mini | | 長時間エージェント(1M) | Nemotron 3 Ultra(要大型HW) | — | コスパ最強:中古RTX 3090(24GB、$700〜)+ Qwen3.6-27B。$1,000でフロンティアクラスのコーディングagentがローカルで動く——2026年の「凡人の最強構成」。Mac(M3 Pro+)ならGemma 4 31B Hereticが万能の最適解。---
```bash ollama pull huihui_ai/qwable-3.6-27b-abliterated:q4_K_M ```
```bash ./llama-server -m Huihui-Qwable-3.6-27b-abliterated-Q4_K_M.gguf -c 8192 ```
Ollamaはデフォルトで「You are a helpful AI assistant…」を付与します。このプロンプトがabliteratedモデルの拒否を再発火させることがあります。
対策: `/set system`でシステムプロンプトを空にする。またはLM Studio/llama.cpp直接使用。Apache 2.0(Qwen系)=商用自由。Gemma利用規約・Mistral系=商用条件を要確認。
---
用途別チャンピオン:万能dense=Gemma 4 31B Heretic、創作/RP=Cydonia 24B v4.3、設定不要の真の自由=Dolphin 3.0 R1 24B、劣化ゼロ=Qwen3.5-35B-A3B Heretic(KL 0.0366)。
MoE低アクティブ化の加速が続くでしょう。Qwen3.7・Gemma 5登場と同時にコミュニティが即日Heretic版を公開するエコシステムはさらに成熟します [推測]。一方、防御技術(Extended-refusal training)も進化中——Hereticの層別最適化はそれに対する最初の反撃です。
第3回は「小規模(4-14B)アンセンサードLLM ベスト10」。Llama-3-ELYZA-JP-8B-Heretic(日本語uncensored決定版)やQwen3.5-9B-HauhauCS(502K DL・lossless宣言)など、8GB GPUでも動くお手軽・爆速の検閲なしAIを解説します。
---
*ベンチマーク数値はhuihui-ai HF・kilo.ai・Z.ai公式・arXiv論文から引用。[推測]と明記された内容は推定です。本記事は技術解説を目的とし、違法行為の助長を意図しません。*