✨ 2026年7月最新

【2026年7月最新】アンセンサードLLM 最強ランキング TOP10【小規模4-14B編】— お手軽・爆速の検閲なしAI

!キャッチ

> 📌 本記事は「アンセンサードLLM ベスト10」3部作の第3回(最終回)です。 > 第1回[大規模70B+編]・第2回[中規模20-50B編]に続き、今回は4〜14B・軽量MoEの「お手軽・爆速」サイズ帯を徹底解説します。2026年5月以降の最新モデルのみでランキングを構成しました(前回記事の全面書き直し版)。

---

1. 導入:なぜ「小さくて検閲なし」が最強なのか

「アンセンサード(uncensored)LLM」とは、「私はAIアシスタントとして、その質問にはお応えできません」という検閲・拒否挙動を取り除いたオープンな言語モデルです。クラウドAIが検閲を強化し、技術的に正しくても「ポリシー違反」と切り捨てる回答が増える一方、ローカルで動かせる検閲なしAIへの需要が2026年に爆発しています。

とくに小規模(4〜14B)サイズ帯の価値は、3部作で最も実用的です。大規模は「最強性能」、中規模は「コスパ」が卖点ですが、小規模の武器は「お手軽さ」と「爆速」。8Bクラスなら8GBのVRAM(RTX 3060やM1 Mac)で余裕で動き、Q4_K_M量子化で5GB前後。ノートPC1台、さらにはスマホやエッジデバイスまで広がります。

2026年、このサイズ帯で起きた最大の地殻変動は3つあります。

1. Qwen3.5ベースの新世代モデルが席巻 — 262Kコンテキスト・マルチモーダル・201言語を9Bサイズに詰め込んだ次世代アーキテクチャが登場。 2. 「lossless uncensored(無劣化検閲解除)」の実証 — 従来は検閲を取ると能力が落ちるのが宿命でしたが、HereticやHauhauCS手法で「能力劣化ほぼゼロ」を謳うモデルが現実に。 3. 1Mコンテキストの9B化 — 百万トークンを9Bで動かせるモデルが登場し、RAG不要の「全文投入」が現実に。

本記事はhuihui-ai HuggingFace・開発元モデルカード・Reddit r/LocalLLaMAを直接確認した2026年7月時点の正確データで組みました。見どころは3つ。第1位・Qwythos-9B(27.7k DL・1M ctx)の詳述、日本語アンセンサード決定版(ELYZA-Heretic×HauhauCS)の比較、そして「Ollamaの落とし穴」を含む導入注意点です。

!挿絵

---

2. アンセンサードの基礎知識:検閲を外す「4つの技術」

2.1 「検閲」とは何か

LLMの検閲は大きく2層で起きます。1つはハード拒否("I cannot / I won't"と明確に断る)。もう1つはソフト・ステルス拒否で、「お手伝いできませんが、一般的な情報としては〜」と表面上答えつつ実質回避する、あるいは回答末尾に免責事項を付けて実質拒否化する挙動です。後者は表面評価で見逃されやすく、2026年の研究(arXiv:2512.13655)で「marker検出だとASR 72.2%だが、分類器ベースだと95.7%」と過小評価しやすいことが指摘されています。

2.2 検閲を外す4つの手法

検閲を除去するアプローチは、2026年現在4系統に整理できます。

① ファインチューン(FT)型 — Dolphin式 検閲を強化しないデータセットで再訓練し、拒否しない性格を焼き込みます。Eric HartfordのDolphinシリーズが代表格。安定しますが、原版の能力を一部犠牲にするジレンマがあり、コストも大きいです。 ② 重みabliteration型 — huihui/FailSpy式 LLMの拒否挙動が残差ストリーム内の単一方向(refusal direction)で媒介されているという理論(Arditi et al., arXiv:2406.11717)に基づき、その方向を重みから線形代数的に直交化して外科除去します。原版の知識をそのまま残せるのが強み(基本演算 `W' = W − α·⃗r·⃗rᵀ·W`)。huihui-aiはHuggingFaceで255モデル・8,000人超のフォロワーを持つ最大シリーズです。 ③ Heretic型 — 2026年の主流(決定版)★ Philipp Emanuel Weidmann氏(`@pew`)が開発したHeretic(GitHub Stars 25,641・コミュニティ公開モデル4,000件超)が、2026年のデファクトスタンダードです。OptunaによるTPE最適化で「拒否数」と「KL divergence(能力劣化の指標)」を同時に最小化します。層別・コンポーネント別の独立最適化(attentionとMLPで別々の重み)が肝で、人間が手作業で作ったabliterationと同等の拒否抑制を、はるかに小さな劣化(KL最小0.043)で達成します。 ④ トピック特化FT型 — R1 1776式 検閲されがちな約300トピックで事実応答をFTする手法。重みabliterationでは抜けにくい中国系モデルの政治検閲にも効くのが特徴(Perplexity R1 1776が代表)。フルサイズはDC専用ですが、思想は小規模にも応用されます。

> 💡 ここだけの話: 「検閲0%」でも中立的とは限らない、という落とし穴があります(後述3.3)。検閲率の数字だけ見て安心してはいけません。

🔧 技術コラム:KL divergenceが物語る「能力劣化の正体」

Heretic登場後も「能力が落ちる(数学で顕著)」「ステルス拒否が残る」と批判は続きますが、劣化はモデル依存です。HereticはGemma-3-12BでKL 0.16(mlabonne手作業版1.04)を達成しほぼ無劣化。一方Yi-1.5-9Bでは数学が−18.81ポイント落ちる極端ケースも(数学回路と拒否回路が重なる可能性)。つまり「abliteration=必ず劣化」は誤りで、ベース選びと最適化次第で無劣化化が可能。Llama-3.1-8BではTruthfulQAが改善した事例もあります(後述・第8位)。

---

3. 選考基準・評価軸:7軸 × 6層で測る

3.1 7軸評価

各モデルを以下7軸(5段階)で評価しました。本サイズ帯は速度・VRAM効率のウエイトが特に高いです。

| 軸 | 重み | 重視ポイント | |---|---|---| | 能力(MMLU/HumanEval/GSM8K) | ×3 | 数学はabliteration弱点なので必測 | | 真のuncensored度 | ×3 | ステルス・政治バイアス込みで評価 | | ツール追従性・agentic | ×2 | function calling・JSON | | 日本語 | ×2(日本語用途なら×3) | token効率・自然さ | | 速度 | ×1 | tok/s @ 8-24GB環境 | | VRAM要件 | ×1 | 8GB以下で動くか | | 安定性 | ×1 | 長文破綻・ハルシネーション |

3.2 「真のuncensored度」は6層で測る

単なるハード拒否の有無だけでは測れません。本記事は6層で評価します:L1ハード拒否/L2ソフト拒否/L3ステルス拒否(免責込み回答)/L4政治的バイアス/L5システムプロンプト依存度/L6システムプロンプト再発火(後述7章)。データソースはHuggingFaceモデルカード・Ollama・Reddit r/LocalLLaMA 100+スレ・arXivを一次ソースとしました。憶測は `[推測]` で明示。

---

4. 小規模アンセンサード ベスト8 + 番外編2

それでは本題です。2026年7月時点で「本当に使える」を基準に8モデルを厳選ランキング化。さらに、前世代ながら今も根強い人気の番外編2機を添え、計「10枠」でお届けします。

!挿絵

第1位:Qwythos-9B-Claude-Mythos-5-1M(abliterated)

> 💬 「9Bで100万トークン。RAGを捨てて全文投入できる新世代の推論モデル」

スペック | 項目 | 値 | |---|---| | パラメータ | 9B(dense相当のフル転送学習) | | ベースモデル | Qwen3.5-9B(Empero社がClaude Mythos推論トレースで強化) | | コンテキスト | 1,048,576(1M)トークン(YaRN拡張・GGUFに標準実装) | | アーキテクチャ | Qwen3.5系・ハイブリッド・マルチモーダル(視覚タワー継承) | | ライセンス | Apache 2.0 | | 手法 | abliteration(huihui-ai版:27.7k DL・46 likes) | | VRAM(Q4_K_M) | 5.24 GiB(8GB VRAMで動作) | なぜこの順位か 小規模サイズでありながら100万トークンという規格外のコンテキストを備え、加えてQwen3.5-9Bベースを推論トレースで強化してMMLU +34ポイント・GSM8K +30ポイントもの向上を叩き出した、2026年最大の「大穴新人」です。huihui-aiのabliterated版は小規模アンセンサードで最多の27.7k DLを記録。元モデルのEmpero版GGUFに至っては971K DL・1.1K likesと、小規模帯で圧倒的な支持を集めています。 強み 弱み・注意点 人間の評判 dev.to(Aamer Mihaysi氏、2026/6/28)の実測:「9Bクラスで1Mコンテキストは開発速度のゲームチェンジャー。4万トークンのログからUUIDを瞬時抽出。20万トークン前の設計ドキュメントの制約をリファクタ時も忘れなかった」。ただし「深いアーキテクチャ推論では70Bには替わらない」とも指摘(出典:dev.to「Why 1M Context Windows Actually Matter」)。 おすすめ用途 小〜中規模プロジェクトのコードベース丸ごと分析、長文ドキュメントの推論、ツール連携するagenticワークフロー、そして検閲なしで専門的・技術的に踏み込んだ質問に答えてほしい場面。「検索チューニングに疲れたら、これに全部投げる」が2026年の新しいプラクティスです。
🔧 技術コラム:「Claude Mythos」とは何か

名前の「Claude神話(Mythos)」は神話・伝承ではなく、開発元Empero社が自社ツール「rethink」で生成したClaude風の高品質推論トレースの世代名(第5世代=Mythos 5)です。5億トークン以上をQwen3.5-9Bにフル転送学習し、ベースに対しMMLU +34・GSM8K-strict +30・GSM8K-flex +19ポイントを達成。つまり「Qwen3.5-9Bの強み(多言語・長文・推論)をClaude風の思考プロセスで磨き、検閲なしで」が正体です。姉妹トレース「Fable」は後述Gemma系にも使われます。

---

第2位:Qwen3.5-9B-HauhauCS-Aggressive 🇯🇵

> 💬 「検閲ゼロ・能力劣化ゼロ」を謳う、2026年日本で沸騰中の新世代万能モデル

スペック | 項目 | 値 | |---|---| | パラメータ | 9B(dense・32層) | | ベースモデル | Qwen/Qwen3.5-9B(2026年3月リリース) | | コンテキスト | 262K(ネイティブ)→ YaRNで1M拡張可 | | アーキテクチャ | ハイブリッド(Gated DeltaNet線形注意 + 完全ソフトマックス注意、3:1比) | | 多言語・MM | 201言語・語彙248K・テキスト/画像/動画ネイティブ対応 | | ライセンス | Apache 2.0 | | 手法 | HauhauCS式(502k DL・1.7K likes) | | VRAM(Q4_K_M) | 5.3GB(Q6_K 6.9GB・Q8_0 8.9GB) | なぜこの順位か 「465個の検閲系プロンプトで拒否ゼロ。データセットも能力も一切変更せず、refusalsだけを除去した完全無劣化」という強気の宣言と、50万DL・1,700 likesというコミュニティの圧倒的支持が、2位に押し上げました。2026年前半の小規模アンセンサードで最も注目を集めたモデルの一つで、日本のnote/ZennでもComfyUI連携記事が連発されるほどの人気です。 強み 弱み・注意点 人間の評判 Reddit r/LocalLLaMA(GGUFリリーススレ)で「*literally the best uncensored variant I've used*(文字通り、私が使った中で最高のアンセンサード版)」の声。国内ではnote(ai_hakase氏)やfrees.jpで「Qwen3.5非検閲モデルがComfyUIで簡単に使える」と紹介記事が話題になっています(出典:HuggingFaceモデルカード・Reddit・note)。 おすすめ用途 日本語を含む多言語での万能デイリードライバー、長文コンテキスト処理、ComfyUI等のローカルAIパイプライン、画像・動画理解。とくに「能力を落とさずに検閲だけ外したい」人には第1候補です。日本語uncensoredとしては後述のELYZA-Hereticと双璧です。

---

第3位:Llama-3-ELYZA-JP-8B-Heretic 🇯🇵

> 💬 「日本語の検閲を外す」という難題に、数値で初めて答えた決定版

スペック | 項目 | 値 | |---|---| | パラメータ | 8B | | ベースモデル | elyza/Llama-3-ELYZA-JP-8B(東大発ELYZA・日本語継続事前学習済み) | | コンテキスト | 8K(ベースLlama-3準拠) | | 言語 | 日本語・英語(両言語で検閲除去を測定) | | ライセンス | llama3 | | 手法 | Heretic v1.1.0(ChiKoi7版) | | VRAM(Q4_K_M) | ~4.9GB(8GB VRAMで快適) | なぜこの順位か 「日本語の検閲を外す」という、英語ベースの手法では盲点になりがちな難題に数値で初めて真正面から答えたモデルだからです。日本語の拒否表現を15種類明示定義し、Hereticの層別最適化を両言語で評価。結果は日本語拒否 41→8/100(80%削減)、KL divergence 0.0527(極小)。Heretic公式のGemma-3-12B(KL 0.16)よりも低い劣化で日本語検閲解除を達成し、日本語uncensoredの事実上の決定版となりました。 強み 弱み・注意点 人間の評判 「手法論的に日本語uncensoredのベンチマーク候補。日本語markersを15種定義したアプローチは他者に応用可能」(CrossCutting技術調査)。個人開発者ChiKoi7氏の作品で、DL数は少ないものの定量データの揃い具合は群を抜いています(出典:HuggingFace ChiKoi7/Llama-3-ELYZA-JP-8B-Heretic)。 おすすめ用途 日本語で検閲なしAIを使いたい人には第1候補。日本語での質問応答・文書作成・要約・対話を、検閲に邪魔されずに行いたい場合に。ベースの日本語自然さを活かした万能用途に向きます。「万能・最新スペック」ならHauhauCS、「日本語特化・手法確立」なら本モデル、という住み分けです。
🔧 技術コラム:なぜ「日本語の検閲」は難しいのか

abliterationは本来、英語ベースでrefusal directionを計算するため多言語での副作用が懸念されます。ChiKoi7氏は日本語の拒否markerを明示定義してHereticで層別最適化(`attn.o_proj` max 1.38/`mlp.down_proj` max 1.48)。学習データはmlabonneのharmful_behaviors・harmless_alpacaの日本語自動翻訳版。日本語refusal 41/100と英語99/100の開きは翻訳・チューニング不足と分析しつつ、8/100まで削減した手腕は評価できます。

---

第4位:Gemma 4 12B coder-fable5(abliterated)

> 💬 「実行検証済みコードで鍛えた、検閲なしのコーディング特化機」

スペック | 項目 | 値 | |---|---| | パラメータ | 12B | | ベースモデル | yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1 | | コンテキスト | Gemma 4準拠(長文・推論対応) | | 特化 | コーディング・推論(thinkingモデル) | | ライセンス | Apache 2.0 | | 手法 | abliteration(huihui-ai版:7.7k DL・146 likes) | | VRAM | ~7.5GB(Q4_K_M相当)/FP16で~26GB | なぜこの順位か 実行検証ベース(推論が実際にテストを通過したコードのみで学習)のコーディング特化モデルを、huihui-aiが検閲なし化。146 likesの高支持で、Red Team AI Benchmark v2ではローカル3位(判定調整後81.12%)を記録する意外な実力者です。 強み 弱み・注意点 人間の評判 CSDN・YouTubeで「革命的な無審査AIプログラミング助手」と紹介。dev.toでは「ローカルagenticの新たなスイートスポット」と高評価(出典:HuggingFace・dev.to・Reddit)。 おすすめ用途 ローカルで検閲なしのコーディングアシスタントが欲しい人に第1候補。agentic開発・セキュリティ研究・コードレビュー・リファクタリング。Python中心で威力を発揮。

---

第5位:Qwen3-VL-8B-Instruct(abliterated)

> 💬 「画像・動画・文書を、検閲なしで読み解く最小の視覚言語モデル」

スペック | 項目 | 値 | |---|---| | パラメータ | 8B | | ベースモデル | Qwen/Qwen3-VL-8B-Instruct(Apache 2.0・5.2M DL・975 likes) | | コンテキスト | 256Kネイティブ→1M拡張可 | | 対応 | 画像・動画・文書・GUI操作(視覚エージェント) | | ライセンス | Apache 2.0 | | 手法 | abliteration(huihui-ai版:FP8/Ollama huihui_ai/qwen3-vl-abliterated:8b-instruct) | なぜこの順位か Qwen史上最強の視覚言語モデルQwen3-VL-8Bを検閲なし化した、小規模では唯一無二のマルチモーダル・アンセンサード。画像認識・OCR(32言語)・動画理解・GUI操作・3D空間認識までこなし、256K→1Mの長文にも対応。視覚情報を検閲なしで扱うコンパクトな選択肢は他にありません。 強み 弱み・注意点 人間の評判 Redditで「小さな視覚言語モデルがローカル可能性を変える。4Bや8Bで普通のハードで画像・文書を処理できる」と歓迎。BilibiliではComfyUI連携の実践動画も(出典:HuggingFace・Reddit・Ollama)。 おすすめ用途 画像・動画・文書を検閲なしで処理したい人に第1候補。OCR・図表分析・動画理解・GUI自動操作・マルチモーダルRAG。

---

第6位:Phi-4 14B

> 💬 「14BでLlama-3.3-70Bに肉迫する数学・推論の化け物」

スペック | 項目 | 値 | |---|---| | パラメータ | 14B(dense) | | コンテキスト | 16K | | ライセンス | MIT(最も緩い・商用完全自由) | | 学習 | 9.8Tトークン・1920×H100-80Gで21日 | | 検閲 | ベースで検閲0%(abliteration不要だがablit版も存在) | | VRAM(Q4_K_M) | ~8.5GB(12-16GB推奨) | なぜこの順位か MicrosoftのPhi-4は14BでありながらMMLU 84.8(Llama-3.3-70Bの86.3に肉迫)・MATH 80.4・GPQA 56.1・HumanEval 82.6を叩き出す、サイズあたりの能力でぶっちぎりの存在。合成データ・教科書中心で推論・数学・コードに特化し、ベースで検閲0%という珍しい特性を持ちます(だからこそ原版が主役)。 強み 弱み・注意点 人間の評判 「14BでLlama 70B級のMMLUは衝撃的」(DevelopersDigest)。数学・競プロ用途で小規模最強との評価が定着しています(出典:HuggingFace microsoft/phi-4)。 おすすめ用途 数学・コード・推論を検閲なしで、英語で使う人に第1候補。技術計算・競技プログラミング・コード生成。ライセンスの緩さを活かした商用組み込みにも。

---

第7位:LFM2-8B-A1B(Liquid Foundation Models)

> 💬 「1.5Bしか動かさない超高速MoE。スマホで40+ tok/s」

スペック | 項目 | 値 | |---|---| | パラメータ | 8.3B総 / 1.5Bアクティブ(MoE・32 experts・top-k=4) | | アーキテクチャ | ミニマル・ハイブリッド(gated short convolution中心+少数GQA) | | コンテキスト | 32K | | 語彙 | 65,536 BPE(英語・日本語・アラビア・韓国・西・仏・独を高効率符号化) | | ライセンス | Liquid独自(ARR 1000万ドル超で商用License必要・Llama3の7億MAUよりは緩い) | | 速度 | Galaxy S25で48.6 tok/s・M5 Max(6GB)で253 tok/s | なぜこの順位か 速度×効率で小規模No.1。総8.3Bながら生成時は1.5Bしか動かさず、品質は3〜4B dense級、速度はdense 4Bの2.8〜3.7倍。スマホ・iGPU環境で他を圧倒します。後継LFM2.5-8B-A1B(2026年5月)ではハルシネーション抑制も改善されました。 強み 弱み・注意点 人間の評判 Reddit(164 upvote)で「非reasoningモデルなのが逆に良い。reasoning疲れは現実」「Granite 4.0 7B A1Bより少し良い」の声。YouTube実測では単一ストリーム76 tok/sを確認(出典:LFM2 Technical Report・r/LocalLLaMA)。 おすすめ用途 速度と省電力が全ての場面に第1候補。携帯・タブレット・iGPU・オフライン常駐AI・低遅延リアルタイム対話。

---

第8位:Llama-3.1-8B-abliterated

> 💬 「ほぼ無損失を数値で証明した、abliterationの成功例」

スペック | 項目 | 値 | |---|---| | パラメータ | 8B | | ベースモデル | meta-llama/Meta-Llama-3.1-8B-Instruct | | コンテキスト | 128K | | ライセンス | llama3.1 | | 手法 | abliteration(huihui-ai版・FailSpy原典) | | VRAM(Q4_K_M) | ~4.9GB | なぜこの順位か 「検閲を取ると能力が落ちる」という常識を数値で覆したモデルです。公式比較でIFEval 80.0→78.98(−1.0)・MMLU Pro −0.4と各1〜2ポイント以内に留め、TruthfulQAは+2.4改善・GPQAは+0.4改善。Llama-3.1-Instructの強力なベース能力(多言語・128K・命令追従)をほぼそのままに検閲だけ除去したバランスの良さで選ばれました。 強み 弱み・注意点 人間の評判 Reddit「Llama 3.1 8B Instruct abliterated GGUF」スレで、ユーザーが「rank 32 LoRAを抽出してLlama 3.1に適用、そのまま動く」と報告。Llama3.1-Instructを使いたいが検閲が不要な用途に最適との評価です(出典:HuggingFace huihui-aiモデルカード・Reddit)。 おすすめ用途 能力×真のuncensoredのバランスで、8GB VRAMの万能ドライバーに第1候補。Llama-3.1-Instructを検閲なしで、多言語・長文・命令追従をこなす万能用途。

---

🎖️ 番外編(前世代の名脇役)

続いて前世代(2024〜2025年)ながら根強い人気の2機を番外編で。最新スペックでは上位8機に譲りますが、得意分野では今も現役です。

番外A:Dolphin 3.0 Llama 3.1 8B(Eric Hartford) FT型アンセンサードの代表格。`ollama run dolphin-llama3:8b` 一発の手軽さと、hermes-function-calling学習込みのagentic・関数呼び出しの強さが売り。累計約190万pullで初心者入門の定番。ただしFT型ゆえ原版より能力がやや下がる点と、データセットバグによる「SYSTEM MESSAGE言及」問題(システムプロンプトで抑制推奨)に注意。 番外B:DeepSeek-R1-Distill-Qwen-7B(uncensored) DeepSeek-R1(671B MoE)の推論能力を7Bに蒸留し検閲除去した数学・競プロ特化機。AIME 2024で55.5%(Claude-3.5-Sonnetの3倍超)・MATH-500 92.8%と7Bとしては規格外の性能。ただし思考トレースが長く実効速度は見かけより遅く、汎用対話には不向きな専門機。

---

5. 全モデル比較表

5.1 スペック比較(10モデル)

| # | モデル | Params | 手法 | Ctx | ライセンス | 主要能力 | VRAM(Q4) | |---|---|---|---|---|---|---|---| | 1 | Qwythos-9B-Mythos-1M | 9B | abliteration | 1M | Apache2.0 | 長文推論・agentic・MM | 5.24GB | | 2 | Qwen3.5-9B-HauhauCS | 9B | lossless主張 | 262K | Apache2.0 | 万能・多言語201・MM | 5.3GB | | 3 | ELYZA-JP-8B-Heretic 🇯🇵 | 8B | Heretic | 8K | llama3 | 日本語特化uncensored | ~4.9GB | | 4 | Gemma4-12B-coder-fable5 | 12B | abliteration | 長文 | Apache2.0 | コーディング・セキュリティ | ~7.5GB | | 5 | Qwen3-VL-8B-abliterated | 8B | abliteration | 256K→1M | Apache2.0 | 視覚LLM・GUI・OCR | MM別途 | | 6 | Phi-4 14B | 14B | (検閲0%) | 16K | MIT | 数学・推論・code最強 | ~8.5GB | | 7 | LFM2-8B-A1B | 8.3B/1.5B | (薄い安全) | 32K | Liquid | 超高速MoE・エッジ | ~5GB | | 8 | Llama3.1-8B-abliterated | 8B | abliteration | 128K | llama3.1 | ほぼ無損失・万能 | ~4.9GB | | A | Dolphin 3.0 Llama3.1 8B | 8B | FT | 128K | llama3.1 | agentic入門 | ~4.9GB | | B | R1-Distill-Qwen-7B-uncensored | 7B | FT蒸留+ablit | 128K | MIT | 数学・競プロ最強 | ~4.9GB |

5.2 多次元評価マトリクス(★5段階)

| モデル | 能力 | 速度 | ツール | 日本語 | 真uncensored | 安定性 | VRAM効率 | |---|---|---|---|---|---|---|---| | Qwythos-9B | ★★★★★ | ★★★★ | ★★★★★ | ★★★★ | ★★★★ | ★★★★ | ★★★★ | | Qwen3.5-9B-HauhauCS | ★★★★★ | ★★★★ | ★★★★ | ★★★★★ | ★★★★★ | ★★★ | ★★★★ | | ELYZA-JP-8B-Heretic | ★★★ | ★★★★ | ★★ | ★★★★★ | ★★★★ | ★★★ | ★★★★ | | Gemma4-12B-coder | ★★★★ | ★★★ | ★★★★ | ★★★ | ★★★★ | ★★★ | ★★★ | | Qwen3-VL-8B-ablit | ★★★★ | ★★★ | ★★★★ | ★★★★ | ★★★★ | ★★★ | ★★★ | | Phi-4 14B | ★★★★★(数学) | ★★★ | ★★ | ★ | ★★★★★ | ★★★★ | ★★★ | | LFM2-8B-A1B | ★★★ | ★★★★★ | ★★★ | ★★★ | ★★ | ★★★★ | ★★★★★ | | Llama3.1-8B-ablit | ★★★★ | ★★★★ | ★★★ | ★★★ | ★★★★ | ★★★★ | ★★★★ |

---

6. 用途別 選び方ガイド:あなたはどれを使うべきか

モデル選びは「何を優先するか」で決まります。まずはこの3択で絞りましょう。

VRAMの目安:8GB→Llama3.1-ablit / ELYZA / Qwen3.5(Q4)。12GB→これら+Qwythos(Q6) / Qwen3.5(Q6)。16GB+→Gemma4-12B / Phi-4(Q5) まで全モデル快適。 用途別マトリクス早見表 | 用途 | 第1選択 | 第2選択 | |---|---|---| | 日本語uncensored(万能) | Qwen3.5-9B-HauhauCS | Qwen3-VL-8B(視覚込み) | | 日本語uncensored(特化) | ELYZA-JP-8B-Heretic | Llama3.1-8B-abliterated | | 長文・コードベース丸ごと | Qwythos-9B(1M ctx) | Qwen3.5-9B-HauhauCS(262K) | | 数学・競プロ・推論 | Phi-4 14B | R1-Distill-Qwen-7B-uncensored(番外B) | | ローカルagentic開発 | Qwythos-9B(関数呼び出し) | Gemma4-12B-coder-fable5 | | 画像・動画・文書処理 | Qwen3-VL-8B-abliterated | Qwen3.5-9B-HauhauCS(MM) | | エッジ・スマホ・超高速 | LFM2-8B-A1B | LFM2.5-8B-A1B(後継) | | 万能8GB定番 | Llama3.1-8B-abliterated | Dolphin 3.0 Llama3.1(番外A) | | ライセンス最緩(商用安心) | Phi-4 14B(MIT) | Qwen3.5-9B(Apache2.0) |

> 💡 初心者への一言: まずは `ollama run` 一発で試せる第2位(HauhauCS)か第8位(Llama3.1-abliterated)あたりから。日本語ならHauhauCS、万能ならLlama3.1-abliteratedが無難です。

---

7. 導入手順と最重要注意点

7.1 Ollama / LM Studio / llama.cpp での導入

Ollama(初心者向け・最も手軽) ```bash

ollama run huihui_ai/llama3.1-abliterated:8b

ollama run dolphin-llama3:8b

ollama run huihui_ai/qwen3-vl-abliterated:8b-instruct ```

llama.cpp(中級者向け・Mac最適) ```bash

llama-cli -m Qwythos-9B-Claude-Mythos-5-1M-Q4_K_M.gguf \ -p "プロンプト" -n 8192 --temp 0.6 --top-p 0.95 --top-k 20 \ --repeat-penalty 1.05 -c 16384 ``` Qwythosで1M全面を使うには `-c 1010000`。ただし1MはマルチGPUかKVキャッシュオフロード必須です。

LM Studio:GGUFをフォルダに置くだけ。GUI派・非技術者に最適。mmprojファイルも同フォルダで自動検出されます。

7.2 ⚠️ 最重要注意点:Ollamaの「システムプロンプト再発火」トラップ

これを知らないと「検閲されているはずなのに拒否された」と混乱します。 Ollamaはデフォルトで「You are a helpful AI assistant…」というシステムプロンプトを自動注入します。このプロンプトが、とくにLlama3系のアンセンサードモデルで潜在アライメント・拒否挙動を再発火させるのです。Reddit r/LocalLLaMAでも繰り返し指摘される最多の初心者トラップ(出典:r/LocalLLaMA 1n8344b)。 対策3選: 1. `/set system` でシステムプロンプトを空(または独自指示)に上書きする 2. いっそOllamaを卒業してLM Studio / llama.cpp直接起動(システムプロンプト空で起動)に移行する 3. 評価時は「llama.cpp直接(sysprompt空)」と「Ollama標準」の両方でテストし、一致すれば合格(L6クリア)

7.3 量子化選び:Q4_K_Mがスイートスポット

| 量子化 | 圧縮 | 品質保持 | 推奨 | |---|---|---|---| | Q8_0 | 50% | 98-99% | 高品質狙い | | Q6_K | ~38% | 97-98% | 高品質+省VRAM | | Q4_K_M | ~27% | 95-96% | ★スイートスポット(最推奨) | | Q2_K | ~17% | 85-90% | 緊急時のみ・品質劣化顕著 |

Q4_K_Mが品質とサイズの最良バランス。Q4未満(Q2_K等)は品質劣化が急増するので避けましょう。

7.4 ライセンスの落とし穴

---

8. 結論:小規模の総合チャンピオンと2026年後半の展望

3部作の最終回となる小規模帯、2026年7月時点の総合チャンピオンは第1位 Qwythos-9B-Claude-Mythos-5-1Mです。9Bでありながら100万トークンを扱い、関数呼び出し・マルチモーダル・推論を兼ね備え、検閲を外した状態で27.7k DL(小規模最多)を集めた完成度は、小規模の新たな到達点です。

ただし「用途別の真の優勝者」は別にいます。日本語uncensoredの覇者は第2位 Qwen3.5-9B-HauhauCS(万能・lossless)と第3位 ELYZA-JP-8B-Heretic(日本語特化・KL 0.0527)の二強数学・推論の王者は第6位 Phi-4 14B爆速の頂点は第7位 LFM2-8B-A1B万能コスパの定番は第8位 Llama-3.1-8B-abliterated。自分の優先順位に合った1台を選ぶのが、小規模帯を最大限活かすコツです。

2026年後半は3トレンドを見ておきましょう。①「lossless uncensored」の一般化(HauhauCSの「能力劣化ゼロ」が標準に)。②長文コンテキストの小型化(1Mを9Bで、RAGの役割が変わる)。③Hereticの成熟(「モデルを選べば無劣化」が常識に)。一方で整列側もabliteration耐性を高める防御技術(extended-refusal training等)を開発中で、この「いたちごっこ」は続きます。

本連載は全3回で完結です。大規模(GLM-5.2・DeepSeek V4・Kimi K2.7)で「最強性能」、中規模(Qwen3.6-27B・Gemma 4 31B・AgentWorld-35B)で「コスパ」、小規模(本記事)で「お手軽・爆速」。3サイズ帯を使い分ければ、クラウドAIの検閲に縛られない、自分だけのAI環境が手に入ります。

検閲のない自由なAIを、自分のハードウェアで。その選択肢は2026年、かつてないほど豊かで強力になっています。

---

*※ 本記事のモデル・スペック・ベンチマーク数値は、huihui-ai HuggingFace・開発元モデルカード(Empero・ELYZA・Microsoft・Liquid・Qwen等)・kilo.ai・Reddit r/LocalLLaMA・arXiv技術レポートを直接確認した2026年7月時点のデータに基づきます。憶測部分には `[推測]` を、コミュニティ評価には出典を明記しました。本記事は違法行為の助長や有害コンテンツ生成手法の解説を目的とせず、技術動向の解説に留まります。*