马力AI和商业思维
26-06-15 15:16 微博认证:知群 CEO 微博新知博主

有些垂直领域的AI应用,其实挺有机会。

比如看外文漫画最难受的一刻,是手机拍照翻译给你蹦出一段文字,可图上那个气泡里还是日文,你得对着译文一句句猜这话到底是谁说的。有个开源项目把这事反过来做了:它直接改图,把译文重新画回原来的气泡里,输出的还是一张漫画,只是字成了中文。

它叫 manga-image-translator,能一键翻译图片和漫画里的文字,再把译文嵌回原来的位置。

先说它跟你手机里那种翻译到底差在哪。普通拍照翻译,本质是「认字 + 给你一段译文」,图归图,文字归文字,两边对不上。这个项目是一条龙跑完五步:先检测图上哪儿有字,再用 OCR(光学字符识别)把字认出来,然后翻译,接着把原文从图上抹掉、顺手把被字盖住的背景补回去,最后按原来的位置和方向(竖排横排它自己判断)把译文重新嵌回去。

说白了,它不是给你一个翻译,是请了个会修图的翻译——连排版带擦字一起替你干了。

这就是它最值钱的地方:你拿到的不是文本框,是一张能直接看的成品图。气泡里写的就是中文,谁说的、对应哪一格,一目了然。

亮点还有几个我觉得挺实在的。

一是翻译引擎可以换。你可以接在线的,DeepL、ChatGPT、DeepSeek、Gemini 这类,质量高,但要联网、要配 key;也可以接离线的本地模型,纯在自己电脑上跑,图根本不出本机(在意版权和隐私的人,这条估计比翻译质量还重要)。

二是它能本地部署,还能对着一整个文件夹批量翻。你收了一堆生肉,不用一张张喂,丢进去让它跑就行。

三是语言挺全,以日语为主,简繁中文、英文、韩文,再加二十多种语言互译都支持。

但也有问题,作者自己在说明里就承认,英文和韩文的文字检测处理得不够好;把译文画回图上的那步渲染,他原话是「勉强能用」,跟专业修图师傅手动嵌字没法比。遇上复杂背景、花哨字体,翻车是常事——字叠在一起、颜色对不上、排版歪了,都见过。

而且翻译质量这事,很大程度上取决于你接的是哪个引擎。接个强的大模型,效果能上一个台阶;接个弱的,那译出来也就那样。所以别指望它「完美翻译」,它给的是一个能让你看懂、省去来回对照的草稿,不是出版级的成品。

这个项目已经做了好几年,到现在攒了约1万颗 star,最近还在更新,协议是 GPL-3.0,开源、能自己拿去改。我自己的感受是,它适合两类活:一类是想看生肉漫画、外文梗图,求个看懂;另一类是做本地化、字幕组想要个能批量打草稿的底子,省掉最枯燥的认字和擦字。

顺便提一句版权,翻生肉、同人图这些,自己看看就好,尊重原作者,别拿去商用盗印。

它是开源的,在 GitHub 上叫 manga-image-translator,作者 zyddnys。

本来有张配图的,但是不知道什么漫画里的,有内容风险,不放了。

#马力的AI知识分享#
#马力的AI开源项目分享#

发布于 北京