《喵呜AI》一款开源多功能AI标注截图软件
喵呜AI:Windows 系统AI屏幕理解工具
最近我开发并开源了一个 Windows 桌面项目:喵呜AI(MewuAI)。它首先是一套截图和录屏工具,但我真正想做的并不是简单地“给截图软件加一个 AI 聊天框”,而是让屏幕上的内容本身成为 AI 可以直接理解、引用和标注的上下文。
为什么做喵呜AI
现在的大模型已经可以理解图片、代码、网页甚至视频,但我们在电脑上使用 AI 时,很多操作依然比较绕。看到一个问题,经常要先截图、保存、上传,再用文字告诉 AI“我说的是右边那个按钮”或者“第三行这里为什么报错”。但很多时候,用户真正想表达的其实只有一句话:你看这里。
所以喵呜AI采用了一个更直接的思路:按下 Shift + Alt + S,框选当前屏幕上的内容,然后直接向 AI 提问。网页、软件界面、代码、图片,甚至一段操作视频,都可以直接成为当前对话的上下文。
AI 的回答,不一定只存在于聊天框
这是喵呜AI目前比较核心的一部分。传统 AI 可能会告诉你“点击窗口右上角第三个按钮”,但软件操作天然带有空间关系,相比用语言描述“左边第二个”“右上方那个按钮”,直接在原位置标出来会更加直观。
因此 AI 可以根据截图内容直接添加圈选、箭头、勾选、区域标记、文字说明以及简单图示,让回答和原始画面建立位置上的对应关系。我希望最终形成的是一种 屏幕内容 → AI 理解 → AI 回答 → 回到原屏幕内容 的完整交互链路,而不是所有电脑问题最后都被压缩成聊天框里的一段文字。
从单张截图扩展到连续内容
我不希望 AI 每次只能理解一张孤立的截图,因此喵呜AI支持引用多张截图、图片附件以及视频继续对话。例如可以先截一个界面,完成一步操作以后再次截图追问,AI 可以结合前面已经引用的内容继续理解,而不是每一次都重新解释背景。
视频分析采用的也是类似思路。录制一段操作过程或者上传已有视频后,可以直接针对视频提问;回答可以关联具体时间位置,点击后跳转到对应片段,并在相关画面中显示 AI 标注。这也是项目之后比较重要的一个发展方向:让 AI 理解的不只是某一个静态画面,而是一段连续的电脑操作过程。
目前的实际效果
圈出重点
让 AI 直接在截图中圈选、打勾或添加说明,也可以继续针对同一画面追问。
原位翻译
译文直接显示在原文字所在的位置,减少原文和翻译结果之间来回对照。
代码讲解
直接框选 IDE 中看不懂或报错的位置,让 AI 对着具体代码区域进行解释。
绘图与批注
AI 可以直接在画面中添加图示,也可以配合手工画笔、形状和文字补充说明。
它本身也是一套完整的截图工具
为了让整个流程不依赖其他截图软件,喵呜AI也实现了区域截图、窗口截图、多屏截图、滚动长截图、贴图、画笔、高亮、箭头、形状、文字、序号、马赛克、OCR、截图翻译、表格提取以及区域录屏等常用能力。录屏支持指定区域、电脑声音和麦克风,并可以导出 MP4 视频、MP3 音频或 GIF 动图。
截图、手工标注、贴图、文字识别和录屏本身都不需要配置 AI,可以直接使用。对我来说,这些能力更多是整个屏幕交互体系的基础设施,而不是项目最终想表达的重点。
不绑定某一家 AI
我不希望喵呜AI最后变成另一个只能使用固定模型的 AI 客户端,因此目前已经支持多种 AI 接入方式,可以根据自己的环境和需求随时切换。
| 接入方式 | 说明 |
|---|---|
| API | 支持 OpenAI 兼容接口、MiniMax、火山引擎等,可以保存多个接入点。 |
| Hermes | 连接电脑上已经配置好的 Hermes,并选择人格和模型。 |
| ChatGPT Work / Codex | 使用电脑上已经登录的 ChatGPT Work / Codex,并选择模型和思考程度。 |
| WorkBuddy | 连接已经安装并登录的 WorkBuddy 桌面客户端。 |
| MiniMax Code | 使用 MiniMax Code 桌面客户端已有的登录状态。 |
我更希望喵呜AI最终扮演的是一个连接 Windows 屏幕内容 ↔ 多模态 AI 模型 的交互层,而不是把用户锁在某一家模型或者某一种 AI 服务里面。
我比较关注的使用场景
软件操作
很多软件问题其实并不适合纯文字描述。遇到 Blender、Unity、Photoshop、Excel 或其他复杂软件时,可以直接框选当前界面问“下一步应该点哪里”,让 AI 结合当前画面进行判断,并直接在对应位置给出标记。
编程与错误排查
遇到 IDE 报错、运行结果异常或者看不懂的代码时,可以直接框选相关区域,让 AI 针对当前画面进行解释。相比复制代码、复制错误信息,再手工补充上下文,这种方式更接近实际操作时遇到问题的状态。
教学与学生自学
这也是我自己比较关注的一个场景。学生在电脑上遇到问题时,经常只能说“我这里和老师的不一样”,但他自己并不知道具体哪里不一样。如果能够直接框选当前画面,让 AI 找出问题所在,甚至直接把错误位置圈出来,很多操作类问题会更容易理解。
因此项目中也加入了教学演示模式。开启以后,截图框选、标注以及新建贴图等内容可以在腾讯会议、极域等屏幕共享环境中显示,更方便老师进行电脑操作类课程的实时演示。
隐私与本地处理
因为这是一个会直接接触屏幕内容的软件,所以我也比较关注哪些内容能够留在本地。目前截图、手工标注、贴图和文字识别等操作都在电脑本地完成,纯文字聊天也不会自动附带当前桌面截图。
只有用户主动使用 AI 分析、翻译等能力时,对应内容才会发送给当前选择的 AI 服务。API Key 会在电脑本地加密保存;如果使用的是云端 AI 服务,对应请求仍然遵循该服务商自己的隐私政策。
当前版本
安装版: MewuAI-Setup-0.3.0-win-x64.exe
免安装版: MewuAI-Portable-0.3.0-win-x64.zip
目前安装包暂时还没有进行代码签名,因此 Windows 可能会提示“未知发布者”。建议只通过项目 GitHub Releases 页面下载安装。
项目开源
项目作者:Abner Stephen。喵呜AI自有源码采用 MPL-2.0 开源协议,允许在遵守协议的情况下进行商业使用。对外分发受 MPL-2.0 覆盖并修改过的文件时,需要按照协议提供对应源码并保留版权和许可声明,第三方组件则分别遵循各自许可证。
接下来
目前 v0.3.0 仍然只是公测版本。截图、录屏、OCR、贴图、AI 对话、截图引用和原位标注这些基础能力已经逐渐搭起来,但我真正想继续探索的其实是一个更大的问题:如果 AI 可以直接理解我们正在看的屏幕、截图、视频以及整个电脑操作过程,那么人与电脑之间的交互还能变成什么样?
过去,我们需要把电脑里的内容复制给 AI。以后也许可以变成:看到哪里,就问哪里;AI 的回答,也直接回到那里。

