Hermes Desktopで動かすローカル無料モデル

Hermes Desktop

Hermes Desktop

Hermes Desktop: Native AI Agent App for Mac, Windows & Linux | Nous Research

つまり、 “ツール呼び出し対応”+“64Kコンテキスト対応”の GGUFモデル だけが Hermes Desktop のローカルモデルとして使える。

https://manabinoyakata.com/2026/08/03/hermes-desktop-local-model-setup

ローカル無料+GGUF+ツール呼び出し+長コンテキスト(64k以上)

モデル名形式コンテキスト長の目安ツール呼び出し備考
Arch-Agent-7B-GGUFGGUF64K◎ 専用ファンクションコーリング7Bで軽め、関数呼び出し特化 Hugging Face
GLM-4.7 32B(GGUF版)GGUF128K◎ ネイティブツール対応長コンテキスト向けローカルLLM promptquorum.com
Qwen 3.x / Qwen 2.5 Coder GGUFGGUF64K〜128K◎ ツール呼び出し対応コード&ツール呼び出しに強い insiderllm.com
Llama 3.1 / 3.3 Functionary / Hermes GGUFGGUF32K〜64K(設定次第)◎ llama.cppネイティブ対応OpenAI風ツール呼び出し Github

ざっくり結論

  • 「無料ローカル+GGUF+ツール呼び出し+64k以上」なら:
  • Arch-Agent-7B-GGUF
    • 7Bで軽く、関数呼び出し専用にチューニングされていて扱いやすい。
  • GLM-4.7 32B GGUF
    • VRAMに余裕があるなら、128Kコンテキスト+ツール呼び出し+長文タスク向きpromptquorum.com
  • Qwen 3.x / Qwen Coder GGUF
    • コード系ツール呼び出しをやりたいなら有力候補。 insiderllm.com

実運用のポイント(最低限)

  • ランタイム:
  • llama.cppOllama を使うと、OpenAI互換のツール呼び出しAPIで扱える。 Github llmconfigurator.com
  • コンテキスト長:
  • モデル側の設定+llama.cpp--ctx-sizeで 64K〜128K を指定。
  • 選び方の目安:
  • 8〜12GB VRAM: Arch-Agent-7B-GGUF / Qwen 7B〜14B
  • 24GB VRAM: GLM-4.7 32B / Qwen 32B / Gemma 4 27B

🔍 VRAM 6GBで動かせる理由(実際の負荷)

  • 7B GGUF(Q4_K_M / Q5_K_M)なら VRAM 5.5〜6GB で収まる

モデルVRAMコンテキストツール呼び出しコード性能総合評価
Qwen2.5-Coder-7B-GGUF6GB64K〜128K★★★★★
Llama-3.1-Hermes-7B-GGUF6GB64K★★★★☆
Arch-Agent-7B-GGUF6GB64K★★★☆☆

🧩 VRAM 6GBで動かせて、Hermesの条件を満たすモデルは?

1. Qwen3:4B-GGUF(256K context)

  • ファイルサイズ:2.5GB
  • コンテキスト:256K(余裕で64K以上)
  • ツール呼び出し:対応
  • VRAM:5〜6GBで動作可能(Q4_K_M量子化)

2. Gemma 4 e2b(128K context)

  • ファイルサイズ:7.2GB
  • コンテキスト:128K
  • ツール呼び出し:対応
  • VRAM:6GBではギリギリ不足

3. Qwen2.5-Coder-7B-GGUF(64K〜128K)

  • ファイルサイズ:4〜5GB
  • コンテキスト:64K〜128K
  • ツール呼び出し:対応
  • VRAM:6GBで動く(Q4_K_M量子化)

コード中心の用途なら最適。

最適モデル(コード中心・VRAM 6GB・Hermes対応)

  • Qwen2.5-Coder-7B-GGUF
    • ツール呼び出し対応
    • 64K〜128Kコンテキスト
    • コード生成が強い
    • VRAM 6GBで動作可能(Q4_K_M)

安定性最優先モデル(Hermes要件完全クリア)

  • Qwen3:4B-GGUF
    • 256Kコンテキスト
    • VRAM 6GBで確実に動く
    • Hermes Desktopの要件を余裕で満たす
    • コード性能は7Bより弱いが、エージェント用途では十分

AI

Posted by eightban