马力AI和商业思维
26-06-15 17:23 微博认证:知群 CEO 微博新知博主

还有一些AI产品的场景,我觉得抓得也很准。

比如读外文资料的时候,最烦的不是看不懂,是来回切窗口。看到一句英文,复制,切到翻译网页,粘贴,看完译文,再切回原来的地方接着读。一段话来回切四五次,思路全断了。

pot 干的事,就是把这一串动作压成一个快捷键。

它是个开源的桌面小工具,跨平台,Windows、macOS、Linux 都能装。核心就两件事,但都挺戳日常痛点的。

第一件是划词翻译。不管你在哪个软件里,浏览器、PDF 阅读器、聊天窗口,鼠标选中那段文字,按一下你自己设的快捷键,译文当场弹出来。不用复制,不用切网页,选中即译。

第二件更省事,是截图翻译。屏幕上任何一块地方,按快捷键框选一下,它先把图片里的文字认出来(这一步叫 OCR,光学字符识别),再翻译。这一下解决的是个老大难:图片、扫描件、游戏画面里的字,你连复制都做不到,以前只能一个字一个字手打。现在框一下就行。

说到这有个很多人会误会的点。

pot 自己其实不会翻译。

它一个字都不翻,它干的是「调度」。你可以把它理解成一个插线板,各家翻译服务是插头,pot 提供插孔,你想用谁就插谁。翻译这边,能接 OpenAI、智谱 AI、Gemini 这些大模型,也能接谷歌、DeepL 和几家传统翻译引擎,甚至能接在自己电脑上跑的 Ollama,连网都不用。OCR 那边也一样,macOS 直接用苹果系统自带的 Vision,Windows 用系统 OCR,Linux 用 Tesseract,这几种都是离线的;想要更准也能接几家云 OCR 服务。

它还能同时调好几家,结果并排摆给你看。我看它界面,一段「Hello World」下面能同时列出 OpenAI、谷歌翻译、火山翻译三家的译文,哪家顺眼用哪家。机翻和大模型的味道差挺多,摆一起一眼就比出来了。

所以它好不好用,一半看 pot,一半看你接了什么。

这话我得说实在点。接个免费的机翻引擎,质量也就那样,跟你平时用翻译网页差不多;接上 GPT 或者 DeepL,那确实是另一个档次。但大模型和云翻译多数要你自己去申请 API key、要联网,配置那一摊对纯小白有点门槛(我第一次配的时候也对着设置页琢磨了一会儿)。系统自带的 OCR 和本地 Ollama 是离线的,这俩不用配 key,开箱就能用。

别的还有些顺手的小功能:翻完的生词能导出到 Anki、欧路词典这类背单词的地方;内置引擎不够用,它有插件系统,能自己加。这些不是主菜,知道有就行。

这项目不是什么新东西,2023年就开始做了,GitHub 上攒了约1.8万颗 star,到现在还在维护更新,不是那种挂着没人管的坟墓项目。开源,用的是 GPL-3.0 协议。

要说最值得装的场景,是你经常要读外文、又懒得切窗口的那种。装好之后先干一件事,进设置里把划词翻译和截图翻译各绑一个顺手的快捷键,引擎随便先接一个能用的。绑完你会发现,读外文这件事的摩擦一下小了一大半。

它在 GitHub 上叫 pot-desktop,是 pot-app 这个组织做的。

#马力的AI知识分享#
#马力的AI开源项目分享#

发布于 北京