喵呜AI:Windows 系统AI屏幕理解工具

最近我开发并开源了一个 Windows 桌面项目:喵呜AI(MewuAI)。它首先是一套截图和录屏工具,但我真正想做的并不是简单地“给截图软件加一个 AI 聊天框”,而是让屏幕上的内容本身成为 AI 可以直接理解、引用和标注的上下文

为什么做喵呜AI

现在的大模型已经可以理解图片、代码、网页甚至视频,但我们在电脑上使用 AI 时,很多操作依然比较绕。看到一个问题,经常要先截图、保存、上传,再用文字告诉 AI“我说的是右边那个按钮”或者“第三行这里为什么报错”。但很多时候,用户真正想表达的其实只有一句话:你看这里。

所以喵呜AI采用了一个更直接的思路:按下 Shift + Alt + S,框选当前屏幕上的内容,然后直接向 AI 提问。网页、软件界面、代码、图片,甚至一段操作视频,都可以直接成为当前对话的上下文。

AI 在网页截图上圈出按钮,并在旁边添加说明
AI 正在理解截图上的界面,并直接在对应位置进行标注

AI 的回答,不一定只存在于聊天框

这是喵呜AI目前比较核心的一部分。传统 AI 可能会告诉你“点击窗口右上角第三个按钮”,但软件操作天然带有空间关系,相比用语言描述“左边第二个”“右上方那个按钮”,直接在原位置标出来会更加直观。

因此 AI 可以根据截图内容直接添加圈选、箭头、勾选、区域标记、文字说明以及简单图示,让回答和原始画面建立位置上的对应关系。我希望最终形成的是一种 屏幕内容 → AI 理解 → AI 回答 → 回到原屏幕内容 的完整交互链路,而不是所有电脑问题最后都被压缩成聊天框里的一段文字。

从单张截图扩展到连续内容

我不希望 AI 每次只能理解一张孤立的截图,因此喵呜AI支持引用多张截图、图片附件以及视频继续对话。例如可以先截一个界面,完成一步操作以后再次截图追问,AI 可以结合前面已经引用的内容继续理解,而不是每一次都重新解释背景。

视频分析采用的也是类似思路。录制一段操作过程或者上传已有视频后,可以直接针对视频提问;回答可以关联具体时间位置,点击后跳转到对应片段,并在相关画面中显示 AI 标注。这也是项目之后比较重要的一个发展方向:让 AI 理解的不只是某一个静态画面,而是一段连续的电脑操作过程。

点击回答中的时间定位视频,播放时标注跟随目标移动
视频分析:点击回答中的时间位置,可以直接跳到对应片段并查看标注

目前的实际效果

圈出重点

让 AI 直接在截图中圈选、打勾或添加说明,也可以继续针对同一画面追问。

AI 在截图中圈出重点并添加勾选标记

原位翻译

译文直接显示在原文字所在的位置,减少原文和翻译结果之间来回对照。

译文显示在截图原文的位置

代码讲解

直接框选 IDE 中看不懂或报错的位置,让 AI 对着具体代码区域进行解释。

代码截图旁的解释与对应代码位置相连

绘图与批注

AI 可以直接在画面中添加图示,也可以配合手工画笔、形状和文字补充说明。

截图上的 AI 绘图与批注

它本身也是一套完整的截图工具

为了让整个流程不依赖其他截图软件,喵呜AI也实现了区域截图、窗口截图、多屏截图、滚动长截图、贴图、画笔、高亮、箭头、形状、文字、序号、马赛克、OCR、截图翻译、表格提取以及区域录屏等常用能力。录屏支持指定区域、电脑声音和麦克风,并可以导出 MP4 视频、MP3 音频或 GIF 动图。

截图、手工标注、贴图、文字识别和录屏本身都不需要配置 AI,可以直接使用。对我来说,这些能力更多是整个屏幕交互体系的基础设施,而不是项目最终想表达的重点。

不绑定某一家 AI

我不希望喵呜AI最后变成另一个只能使用固定模型的 AI 客户端,因此目前已经支持多种 AI 接入方式,可以根据自己的环境和需求随时切换。

接入方式 说明
API 支持 OpenAI 兼容接口、MiniMax、火山引擎等,可以保存多个接入点。
Hermes 连接电脑上已经配置好的 Hermes,并选择人格和模型。
ChatGPT Work / Codex 使用电脑上已经登录的 ChatGPT Work / Codex,并选择模型和思考程度。
WorkBuddy 连接已经安装并登录的 WorkBuddy 桌面客户端。
MiniMax Code 使用 MiniMax Code 桌面客户端已有的登录状态。

我更希望喵呜AI最终扮演的是一个连接 Windows 屏幕内容 ↔ 多模态 AI 模型 的交互层,而不是把用户锁在某一家模型或者某一种 AI 服务里面。

我比较关注的使用场景

软件操作

很多软件问题其实并不适合纯文字描述。遇到 Blender、Unity、Photoshop、Excel 或其他复杂软件时,可以直接框选当前界面问“下一步应该点哪里”,让 AI 结合当前画面进行判断,并直接在对应位置给出标记。

编程与错误排查

遇到 IDE 报错、运行结果异常或者看不懂的代码时,可以直接框选相关区域,让 AI 针对当前画面进行解释。相比复制代码、复制错误信息,再手工补充上下文,这种方式更接近实际操作时遇到问题的状态。

教学与学生自学

这也是我自己比较关注的一个场景。学生在电脑上遇到问题时,经常只能说“我这里和老师的不一样”,但他自己并不知道具体哪里不一样。如果能够直接框选当前画面,让 AI 找出问题所在,甚至直接把错误位置圈出来,很多操作类问题会更容易理解。

因此项目中也加入了教学演示模式。开启以后,截图框选、标注以及新建贴图等内容可以在腾讯会议、极域等屏幕共享环境中显示,更方便老师进行电脑操作类课程的实时演示。

隐私与本地处理

因为这是一个会直接接触屏幕内容的软件,所以我也比较关注哪些内容能够留在本地。目前截图、手工标注、贴图和文字识别等操作都在电脑本地完成,纯文字聊天也不会自动附带当前桌面截图。

只有用户主动使用 AI 分析、翻译等能力时,对应内容才会发送给当前选择的 AI 服务。API Key 会在电脑本地加密保存;如果使用的是云端 AI 服务,对应请求仍然遵循该服务商自己的隐私政策。

当前版本

MewuAI v0.3.0 公测版

安装版: MewuAI-Setup-0.3.0-win-x64.exe

免安装版: MewuAI-Portable-0.3.0-win-x64.zip

目前安装包暂时还没有进行代码签名,因此 Windows 可能会提示“未知发布者”。建议只通过项目 GitHub Releases 页面下载安装。

项目开源

项目作者:Abner Stephen。喵呜AI自有源码采用 MPL-2.0 开源协议,允许在遵守协议的情况下进行商业使用。对外分发受 MPL-2.0 覆盖并修改过的文件时,需要按照协议提供对应源码并保留版权和许可声明,第三方组件则分别遵循各自许可证。

接下来

目前 v0.3.0 仍然只是公测版本。截图、录屏、OCR、贴图、AI 对话、截图引用和原位标注这些基础能力已经逐渐搭起来,但我真正想继续探索的其实是一个更大的问题:如果 AI 可以直接理解我们正在看的屏幕、截图、视频以及整个电脑操作过程,那么人与电脑之间的交互还能变成什么样?

过去,我们需要把电脑里的内容复制给 AI。以后也许可以变成:看到哪里,就问哪里;AI 的回答,也直接回到那里。