使用本地大模型养马(Hermes Agent)和虾(OpenClaw),持续更新
时间:07月12日 人气:...

本文仅围绕本地大模型在“养马”(Hermes Agent)和“养虾”(OpenClaw)场景下的使用建议展开,不讨论云端大模型,也不对比二者优劣。若您使用云端模型,请直接关闭本文,无需继续阅读。

本地模型选择

当前大模型迭代极快,几乎每隔一段时间就有新版本发布——但其中绝大多数是云端模型,鲜有适合本地部署的版本。真正能在家用机(需配备独立显卡/GPU)上跑起来、且能胜任“养马养虾”任务的模型,选择十分有限。

经过我的一系列对比测试,截至2026年6月,在家用机上效果最好的本地模型是 Qwen3.6-27B。后续我也会持续跟进,更新推荐列表。

需要特别提醒:同系列的 Qwen3.6-35B-A3B 虽然参数标称更大,但它是 MOE(混合专家)架构,推理效果远不如 Qwen3.6-27B,请勿选错。

部署方式

  • 若您的显存非常充裕,直接用 Ollama 部署即可,操作极其简单,几乎“傻瓜式”。
  • 若和我一样显存捉襟见肘,则建议使用 llama.cpp。它的优势在于:能优先使用显存,显存不足时自动切换至内存,而 Ollama 在显存不够时容易报错异常。

以 llama.cpp 加载 Qwen3.6-27B 为例,将上下文设为 256K,并分配到两张显卡上,命令如下:

llama-server -m Qwen3.6-27B-Q4_K_M.gguf --host 0.0.0.0 --port 8888 -ngl 99 --tensor-split 22,22 -c 262144 --parallel 1 -t 8 --timeout 1800 --api-key sk-change-me --temperature 0.2 --flash-attn on --keep 16384 --alias qwen3.6:27b --no-ui --context-shift --mlock

我使用的两张 N 卡较为老旧,加载完成后约占用 40GB 显存 + 20GB 内存,初始推理速度约为 20 token/秒,效果完全可接受。相比 RTX 40/50 系显卡的价格,这还要啥自行车?
当然,若降低上下文长度或调整 KV Cache,可进一步减少内存占用,但会牺牲使用体验。只要硬件够,建议尽量调大。

安装方式选择(虾/马)

  • 嵌入式开发场景(需外接嵌入式设备,由 虾/马 协助开发):首选虚拟机,次选实体机安装 Linux。不推荐 WSL 和 Docker,因为两者接入外部设备非常麻烦(虽然技术上可行,但操作繁琐,失去便捷意义)。
  • 文本分析、内容写作、纯代码编写调试等轻量场景:非常推荐 WSL 或 Docker,尤其在 Windows 系统下,WSL 安装部署最为方便。

OpenClaw(虾)

官网:https://openclaw.ai
目前网上已有许多中文教程,搭建过程不复杂,此处不再赘述。

但我实测发现,即便为 OpenClaw 设置了 timeoutSeconds 参数且值很大,搭配本地 Qwen3.6-27B 时,任务仍频繁因各类超时而中断。体验下来,OpenClaw 似乎不太适合此本地模型。在试用 Hermes Agent 后,我便彻底放弃了继续折腾 OpenClaw 的动力。

Hermes Agent(马)

官网:https://hermes-agent.nousresearch.com
同样有很多中文站点可供参考搭建。

坦白说,官方界面的美术风格我欣赏不来——无论是 TUI 还是 Dashboard,都带着浓重的字符界面感。因此,目前社区提供了不少第三方 Web 界面,例如 open-webui,但我更推荐搭配 ekkoye8888/hermes-web-ui,其界面更符合国人使用习惯。

下面给出几组适合的配置参数:

hermes config set agent.reasoning_effort high
hermes config set tool_output.max_bytes 100000
hermes config set tool_output.max_lines 3000
hermes config set code_execution.timeout 600
hermes config set code_execution.max_tool_calls 80
hermes config set terminal.timeout 300
hermes config set compression.threshold 0.65
hermes config set compression.target_ratio 0.3
hermes config set compression.protect_last_n 30

在实际使用中,我将 Hermes Agent 搭配 Qwen3.6-27B 模型,让它阅读网页技术文档、设计测试用例并完成功能验证。整个过程推理稳定,没有出现空想或死循环,表现如同一位经验丰富的老手,非常可靠。可以说,Hermes Agent 在本地大模型场景下的实用性很强,效果令人满意。

交流

目前随便写了写,先写到这里吧。感兴趣的朋友欢迎加 QQ群:32777564 一起探讨!

上一篇:WM IoT SDK 云编程体验系统
下一篇:没有下一篇了
最美丽江花花草草大美长白山西北环形古都长安
推荐文章