本地 AI 引擎:Ollama 配置与推荐模型
Senzoukria 可以通过 Ollama 或 LM Studio 这类本地引擎,用运行在你自己机器上的模型作答。应用会探测引擎、只列出真正已安装的模型,并在一个都没有时建议可以拉取的模型。
Senzoukria · 文档 · 更新于 2026 年 9 月
位置
- 位置
- AI 页面 → 模型选择器,以及 设置 → AI
- 默认地址
- http://127.0.0.1:11434 —— 回环地址,任何内容都不会离开本机
- 默认上下文窗口
- 8 192 tokens(8k)
- 模型列表
- 向引擎询问得来;绝不写死
- 密钥
- Claude 密钥以 sk-ant- 开头,存放在操作系统密钥库中;Groq 密钥以 gsk_ 开头
它做什么
应用会探测本地引擎并报告它测到的结果:引擎是否应答、版本号、往返延迟,以及它声明的模型——只要引擎公布,每个模型还会附上磁盘占用、参数量和量化方式。关闭着的引擎会返回「无法连接」和原始信息,这是一个结果而不是一个诊断:它并不说明问题出在密钥、网络还是服务上。
请求经由应用的 Rust 后端而不是 web 视图发出,原因有二:内容安全策略不允许前端打开本地 HTTP 端口,而且网络请求本来也不属于那一层。
由于列表来自引擎,你没有的模型绝不会显示为可选。这就留下了引擎无法回答的一个问题——一个都没有时该装什么——而建议列表正是为此而设。
推荐模型
| 设置 | 默认值 | 它改变什么 |
|---|---|---|
| qwen2.5-coder:7b | 约 4.7 GB | 列表首位:编写指标代码,专用的 7B 在这方面经常胜过通用的 8B |
| qwen3:8b | 约 5.2 GB | 常规问题 |
| deepseek-r1:8b | 约 5.2 GB | 逐步推理 |
| llama3.1:8b | 约 4.9 GB | 常规问题 |
| gemma2:9b | 约 5.4 GB | 常规问题 |
| qwen2.5:3b | 约 1.9 GB | 配置较低的机器 |
怎么配置
- 自己安装一个引擎——Ollama 或 LM Studio——并让它保持运行。Senzoukria 从不安装引擎;它只与已经存在的引擎对话。
- 拉取一个模型。选择器会显示可直接粘贴的命令,形如 ollama pull qwen2.5-coder:7b,而「安装」按钮会让你已有的引擎去获取它。进度以引擎自己的步骤名称呈现,因为 Ollama 是按层统计字节的,用百分比会在每进入新的一层时掉回零。
- 模型一旦安装,对应的建议就会从列表中消失——它随即出现在真正的已安装模型列表里。
- 在 设置 → AI 中设置上下文窗口。默认的 8k 可以容纳助手提示词、盘面上下文和一段短对话;Ollama 自身默认的 4 096 不够用。
限制与陷阱
- 本地模型是一个免费的备选,而不是同等水平:它明显不如 Claude,会漏掉 Claude 能抓住的东西。作为交换,你写下的任何内容都不会离开本机。
- 本地引擎只接收纯文本,因此无论模型自称支持什么,截图都不会传到它那里。
- nomic-embed-text 这类嵌入模型会被 Ollama 与对话模型列在一起,但它们完全无法作答;选择器会把它们标出来。
- 这里的大小是默认量化下的下载体积,还需要同一量级的空闲内存:一个 5 GB 的模型在不足 8 GB 空闲内存时跑不顺畅。
- 建议列表偏向 7B 及以上,因为在指标代码上更小的模型往往写出看似合理却跑不起来的代码;唯一的 3B 条目是留给装不下更大模型的机器的。
相关页面
其他语言版本
常见问题
- Senzoukria 会自己安装 Ollama 或下载模型吗?
- 不会。引擎由你安装。「安装」按钮只是向该引擎转发一条明确的拉取指令,命令本身也会显示出来,方便你在自己的终端里执行。
- 为什么我的模型列出来了却没用?
- 多半它是一个嵌入模型。这类模型返回向量而不是回答;选择器会把它们标出来,以免选错被当成功能故障。
- 我的 Claude API 密钥存在哪里?
- 存在你操作系统的密钥库中,且只在本机使用。对话和你附加的任何截图会用你的密钥发往 Anthropic;没有任何内容经过 Senzoukria 的服务器。