Hermes Desktopで動かすローカル無料モデル
Hermes Desktop
Hermes Desktop
Hermes Desktop: Native AI Agent App for Mac, Windows & Linux | Nous Research
つまり、 “ツール呼び出し対応”+“64Kコンテキスト対応”の GGUFモデル だけが Hermes Desktop のローカルモデルとして使える。
https://manabinoyakata.com/2026/08/03/hermes-desktop-local-model-setup
ローカル無料+GGUF+ツール呼び出し+長コンテキスト(64k以上)
| モデル名 | 形式 | コンテキスト長の目安 | ツール呼び出し | 備考 |
|---|---|---|---|---|
| Arch-Agent-7B-GGUF | GGUF | 64K | ◎ 専用ファンクションコーリング | 7Bで軽め、関数呼び出し特化 Hugging Face |
| GLM-4.7 32B(GGUF版) | GGUF | 128K | ◎ ネイティブツール対応 | 長コンテキスト向けローカルLLM promptquorum.com |
| Qwen 3.x / Qwen 2.5 Coder GGUF | GGUF | 64K〜128K | ◎ ツール呼び出し対応 | コード&ツール呼び出しに強い insiderllm.com |
| Llama 3.1 / 3.3 Functionary / Hermes GGUF | GGUF | 32K〜64K(設定次第) | ◎ llama.cppネイティブ対応 | OpenAI風ツール呼び出し Github |
ざっくり結論
- 「無料ローカル+GGUF+ツール呼び出し+64k以上」なら:
- Arch-Agent-7B-GGUF
- 7Bで軽く、関数呼び出し専用にチューニングされていて扱いやすい。
- GLM-4.7 32B GGUF
- VRAMに余裕があるなら、128Kコンテキスト+ツール呼び出し+長文タスク向き。 promptquorum.com
- Qwen 3.x / Qwen Coder GGUF
- コード系ツール呼び出しをやりたいなら有力候補。 insiderllm.com
実運用のポイント(最低限)
- ランタイム:
llama.cppかOllamaを使うと、OpenAI互換のツール呼び出しAPIで扱える。 Github llmconfigurator.com- コンテキスト長:
- モデル側の設定+
llama.cppの--ctx-sizeで 64K〜128K を指定。 - 選び方の目安:
- 8〜12GB VRAM: Arch-Agent-7B-GGUF / Qwen 7B〜14B
- 24GB VRAM: GLM-4.7 32B / Qwen 32B / Gemma 4 27B
🔍 VRAM 6GBで動かせる理由(実際の負荷)
- 7B GGUF(Q4_K_M / Q5_K_M)なら VRAM 5.5〜6GB で収まる
| モデル | VRAM | コンテキスト | ツール呼び出し | コード性能 | 総合評価 |
|---|---|---|---|---|---|
| Qwen2.5-Coder-7B-GGUF | 6GB | 64K〜128K | ◎ | ◎ | ★★★★★ |
| Llama-3.1-Hermes-7B-GGUF | 6GB | 64K | ◎ | ○ | ★★★★☆ |
| Arch-Agent-7B-GGUF | 6GB | 64K | ◎ | △ | ★★★☆☆ |
🧩 VRAM 6GBで動かせて、Hermesの条件を満たすモデルは?
1. Qwen3:4B-GGUF(256K context)
- ファイルサイズ:2.5GB
- コンテキスト:256K(余裕で64K以上)
- ツール呼び出し:対応
- VRAM:5〜6GBで動作可能(Q4_K_M量子化)
2. Gemma 4 e2b(128K context)
- ファイルサイズ:7.2GB
- コンテキスト:128K
- ツール呼び出し:対応
- VRAM:6GBではギリギリ不足
3. Qwen2.5-Coder-7B-GGUF(64K〜128K)
- ファイルサイズ:4〜5GB
- コンテキスト:64K〜128K
- ツール呼び出し:対応
- VRAM:6GBで動く(Q4_K_M量子化)
→ コード中心の用途なら最適。
最適モデル(コード中心・VRAM 6GB・Hermes対応)
- Qwen2.5-Coder-7B-GGUF
- ツール呼び出し対応
- 64K〜128Kコンテキスト
- コード生成が強い
- VRAM 6GBで動作可能(Q4_K_M)
安定性最優先モデル(Hermes要件完全クリア)
- Qwen3:4B-GGUF
- 256Kコンテキスト
- VRAM 6GBで確実に動く
- Hermes Desktopの要件を余裕で満たす
- コード性能は7Bより弱いが、エージェント用途では十分











ディスカッション
コメント一覧
まだ、コメントがありません