视觉模块与 Vision Capture:让 AIRI 看见你的屏幕
视觉模块让 AIRI 理解图像输入——屏幕画面或摄像头内容。这是机体模块里「开发中」色彩最重的一个,官方文档对它写得也最细,值得照着走。
配置分两层
第一层:服务商与模型(纯配置,随时可做)
- 「设置 → 服务来源 → 视觉」选择服务商。视觉与聊天共用凭据——同一家的视觉页字段与其聊天版本一致,所以先在聊天服务商里配好这一家,视觉页直接复用。
- 「设置 → 机体模块 → 视觉」选择明确支持图像输入的模型。纯文本模型做不了视觉任务,这是官方反复强调的点。
- 需要时可设置 Capture interval(捕获间隔)。
第二层:Vision Capture(桌面端工具,想分析屏幕才需要)
前往「系统 → 开发者 → Vision Capture」:授予屏幕录制权限 → 选择要捕获的窗口或显示器 → 点「Start ticker」→ 要把识别结果送进对话再开「Publish to character」。
注意官方的定位说明:Vision Capture 目前是桌面端调试/开发工作流,离开该页面捕获循环就会停止。也就是说「她一直看着你屏幕」这件事现阶段还不是常驻形态。
校验方法
官方建议用一张不含敏感信息的测试画面触发一次分析,AIRI 能描述画面即为配置成功。
隐私清单(配置前先读)
官方文档在视觉页放了明确的警告:视觉分析会把画面发送给所选服务商——
- 不要捕获包含密钥、密码、个人信息的画面;
- 云端凭据也不要出现在被捕获的画面里;
- 本地方案可选:Ollama 与 LM Studio 支持本地视觉模型,画面不出本机,代价是对显卡有要求。
接下来
- 想让她查最新信息而非看屏幕:网络搜索模块。
- 视觉模型怎么挑:给 AIRI 选大脑。