我也不信任 vLLM,输出看起来正确,其实错误的文本,会让工作更加头痛。
阿里新发布的 Qwen3-VL-32B 识别生僻字比较强,没细测,认字能力可能和合合、百度高精度这些专业的ocr模型差不多了。
Qwen3-VL-32B 的识别结果:
後漢書集解述略
范氏撰後漢書原定十紀、十志、八十列傳,合為百篇。本史通正史篇。蓋取與班氏前漢書相應,其敘例論贊。
始均別行。范獄中書云紀傳例爲舉其大略,劉昭補志序云范敘例所論備精與章。章懷注光武紀、安紀並曾引范敘例之文,自應別有傳述。隋志別有范氏後漢讚論四卷,唐志作論贊五卷,宋志始不著錄,當由已無單行本。紀傳
先成。十志未及編作,久遂全佚。章懷注帝后紀、十皇女下云:沈約謝嚴傳范所撰十志,一皆託嚴搜撰垂畢,遇范敗悉蠟以覆車,不復得。按此所引沈約儼傳,宋書不載,今無可考。但范有百官志,已見帝后紀、有禮樂志、輿服志,見東平王蒼傳;有五行志、天文志,見蔡邕傳;又南齊書文學傳檀超掌史職,議立十志,百官依范曄合州郡,是范志齊時尚有存者。超目見能舉其例,至梁乃全佚,恐蠟以覆車之說,特指餘志未成者也。序例疑亦未備。
劉昭補志序。寢至並亡。范傳載范獄中爲書與甥姪敍其作後漢書大略,自負特甚,然固不愧體大而云序或未周。
思精也。書云吾狂釁覆滅,豈復可言?汝等皆當以罪人棄之。然乎生行己在懷猶應可尋,至於能不意中所解,汝等或不悉知。吾少懶學問,晚成年人年三十許,政始有向耳。自爾以來,轉爲心化,推老將至者,亦當未已也。往往有微解,言乃不能自盡,爲性不尋注書,心氣惡小苦思,便憤悶口機又不調利,以此無談功,至於所通解處,皆自得之於胸懷耳。文章轉進,但才少思難,所以每於操筆其所成篇,殆無全稱者,常恥作文士文,患其事盡於形情,急於藻義,牽其旨韻,移其意,雖時有能者,大較多不免此累。政可類工巧圖繢,竟無得也。常謂情志所託,故當以意爲主,以文傳意。以意爲主,則其旨必見;以文傳意,則其詞不流。然後抽其芬芳,振其金石耳。此中情性旨趣,千條百品,屈曲有成理,自謂頗識其數,嘗爲人言,多不能賞意,或異故也。性別宮商,識清濁,斯自然也。
述略
你用api远程调用试试,没五十张就可以显见的看到他的缺点——指令依循度差、违禁词阈限低,网页的效果打九分,商业api调用只能打五分,阿里这尿性也是没谁了
我尽量避免使用国内模型的api,这破玩意都要实名认证,何苦来着,有那么稀罕?
还行,等个一年半载,兴许能改改这个毛病,阿里现在是啥都发展啥都不精进
阿里的qwen系列实际现在是开源模型社区的顶梁柱,模海战术,全面铺货,大杀四方,什么meta、mistral都被扫进了垃圾堆。
Gemini 3 Pro Preview识别中文生僻字的能力有所提升,但进步并不大,没有达到 Qwen3-VL-32B 的水准。
这是新明解词典的外字码表,我之前让不同模型识别了一次
GPT一直说无法识别:
我已经尝试用本地可用的 OCR 识别这张字体表,但系统中 没有可用的日文 / CJK OCR 模型(tesseract 语言包 jpn/chi 等不存在),因此识别结果几乎不可用,无法自动提取图中的 30×N 字符网格。
Claude说安全原因无法识别,
Grok识别几行后开始死循环:
- 萬吶嘻嚦圮塏殤掺摹皪腊杛柿柧椰椎毬汙洎灶吶磅釜仹渼环尅蛍噪碇
- 砕硏硼窮畚颪熊槐樛徃龜毅音眩香蔦壹賜蔭蕃虬蜆蝙螨袂裟縑鞫閃陁
- 闔邏鄱醞醢鑞鑠鑰龝齡齶孃孖孀孅孇孊孋孎孏孒孖孖孖孖孖孖孖孖孖
- 孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖
- 孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖孖
gemini 2.5一次识别正确大部分符号,但文字有很多错的:
厲,呍,嘻,噯,圮,坿,毅,拑,摹,攴,腊,柿,枘,杻,梛,種,歩,沐,泊,炐,炘,膀,薛,狀,犭,玕,珂,侳,慓,矻
磈,碵,碯,窼,篰,箙,簏,糢,糝,紃,縕,穀,者,眩,蕃,蔟,薏,藾,薩,薯,虯,蜋,蝘,螭,袪,袞,褊,覲,跗,跫
辶,邃,邂,酴,醢,醠,鐔,鞴,髟,𩸽,鮊,麀,靨,潭,薺,搋,摛,丰,嚮,叛,疐,分,,,,,|,,,彳,嗩,噉,圀
寃,々,夐,犰,潢,襄,寇,茵,蕈,筧,訒,悄,怳,膊,樗,逹,櫑,季,箘,箠,籔,籥,笵,鵁,鶇,螨,蝒,蠊,蠝,醡
醼,鐽,0,/,\,/,0,1,2,3,5,6,7,0,1,0,1,2,3,4,5,6,7,8,9,。,/,!,〃,ゑ
ゝ,ゞ,・,◦,、,〃,〃,〝,〟,〝,〟,≒,〞,<,「,〖,〗,〒,‖,≒,=,√, ̄,2,5,℉,$,㎜,㎞,lb
cc,㎾,ㄟ,©,Ⓤ,
,
,
,●,○,(,),□,⇩,
,➲,―,+,Ⅰ,Ⅱ,~,…,-,?,!,β,œ,‘,“,',ff
£,É,Ä,Å,á,é,í,ó,à,è,â,ê,î,ô,û,ä,ë,ï,ö,ü,ā,ē,ī,ō,ã,å,c,ñ,´,`
~,ˇ,Π,Ω,α,β,γ,δ,μ,ν,π,υ,c,w,ë,~,『,〔,〕,』,∧,|,⊿,籔,噲,嗾,堙,塃,棰,嫏
摺,搗,湝,澤,梀,樢,橾,樮,索,梘,梲,橅,檹,植,梀,桀,胼,腭,胳,膍,玫,琰,瑋,鮁,硑,硨,碟,禝,施,筴
筇,篋,筓,簐,籒,箴,籙,笒,粃,糑,紇,蝪,蜥,蜓,蝜,蝯,蠠,鈸,鋹,錮,鍰,鑠,韃,鮃,鮠,鯆,鰌,鯉,鯇,鮞
鱆,鮓,鯷,飯,鱠,鱣,鱦,孑,刁,乂,敳,靨,兎,莛,瀿,仝,离,嬴,劄,嫂,愒,梟,牴,邙,羅,皷,煤,欲,篶,忿
广,癤,晌,亝,睺,毗,耔,稽,卑,翔,翩,舩,艘,醺,跑,躇,諱,諛,腔,餛,顋,骶,鵺,鵯,鶇,鷆,鷉,鷂,鴇,蘭
潢,圻,桴,祛,蝉,瘉,炅,昊,鮠,鰛,鮞,魨,鱚,鮐,驎,爇,¨,ˆ,ˇ,¯,〆,八,分,公,松,総,船,穴,沿,盆
粉,紛,翁,聡,訟,貧,鉛,雰,頌,頒,ⓐ,ⓑ,ⓒ,ⓓ,q,l,q,l,㊣,他,動,名,動,㊩,記,㊔,㊯,㊪,Ex,⇒
⇔,Ⓐ,Ⓑ,ⓒ,Ⓓ,Ⓔ,Ⓕ,㋐,㋑,㊀,㊁,㊂,㊃,㊄,㊅,㊆,㊇,㊈,㊉,㊏,悪,善,[0],[1],[2],[3],[4],[5],[6],[7]
[8],[9],[10],[11],[12],[13],[14],[15],[16],[17],ṁ,ś,š,ṽ,〓,卜,う,は,
,↷,↺,ゝ,よ,む,♪,○,兀,♮,㐂,ゟ
√,※,卐,⏎,『,┗,』,/,◦,、,・,:,␣,␣,␣,[,],⌒,⌒,⌒,⌒,⌒,⌒,⌒,⌒,⌒,一,二,*,*,︽
︾,‖,┌,┐,(,),[,],△,(,(,―,・,▀,▀,▀,四,五,□
刚测试了下3.0识别结果,文字多对了几个,但还是有不少错。
厲,呍,嘻,噯,圮,坿,毅,拗,摹,壈,腊,柿,枘,杻,哪,種,步,沐,泊,炷,熮,膀,犜,狀,𤞈,玗,甁,疦,癘,矼
砰,确,硼,窠,篰,箄,籠,糢,糝,紃,纐,者,眩,瞶,蕞,薏,薤,薩,薯,螽,蠟,蟬,螭,袪,袗,褊,觀,跗,跼,踈
辶,邃,邇,酴,醖,醍,鐔,鑚,鬃,鮐,鮃,麼,黽,潭,莽,搴,摠,丰,嚮,叛,痃,分,、,、,|,、,彳,哨,噉,国
冤,唹,夐,弖,潢,襄,蔻,茵,蕈,筧,紉,忻,怳,膊,楮,達,槌,季,韵,箠,籔,簌,毚,鵆,鶇,蟎,虯,纒,纈,醡
醼,鐽,0,~,\,/,0,1,2,3,5,6,7,0,1,0,1,2,3,4,5,6,7,8,9,。,/,!,!!,?
?,•,°,、,〃,〃,〃,㍉,=,=,〝,<,「,『,』,〒,‖,≒,=,√, ̄,2,5,°F,$,㎜,㎞,lb,cc
㎾,\,©,®,
,
,
,○,(,),□,⇩,
,0,—,+,Ⅰ,Ⅱ,~,…,-,?,!,β,œ,‘,“,”,ff,£,É
Ä,Å,á,é,í,ó,à,è,â,ê,î,ô,û,ä,ë,ï,ö,ü,ā,ē,ī,ō,ã,å,c,ñ,´,˜,ˇ,˘
Π,Ω,α,β,γ,δ,μ,ν,π,υ,ω,ë,~,〖,〔,〕,〗,^,|,⊿,籔,噲,堠,堙,堉,埵,塳,揩,搗
湑,溼,梿,槞,檞,栅,索,槻,梲,橅,橿,櫨,楝,桀,胼,腭,膰,臈,臙,玫,琰,璹,韂,砡,硨,碟,禔,袟,筴,箐
筓,簛,籏,箴,簶,笒,粃,糂,紇,蜥,蜴,蜓,蜆,䗪,鈸,鋧,錮,鋹,鑠,韃,魞,魸,鯆,鯁,鯢,鲕,鱆,娩
鯷,飯,鱠,鱣,鱯,孑,刁,乂,厃,厞,兎,尫,翏,仝,离,嬴,劬,嫂,愰,愬,胝,邙,羅,皷,煠,鱚,籖,忿,疒,癧
晌,曁,睺,毗,秱,稽,皁,翐,翩,舳,艘,艝,跑,蹘,踛,諍,諛,膣,錕,顚,骶,鵈,鵐,鵞,鰸,鵯,鷦,鶇,蘭,黌,圻
桴,祛,蝉,癧,昃,昊,鯲,鮖,鮗,鮴,鮟,鮠,驎,犨,¨,¨,<,>,?,八,分,公,松,総,船,穴,沿,盆,粉,紛,翁
聡,訟,貧,鉛,雰,頌,頒,ⓐ,ⓑ,ⓒ,ⓓ,q,ℓ,q,ℓ,〡,〣,他,動,名,動,[医],記,〄,々,〆,〼,⇒,⇔,Ⓐ,Ⓑ
Ⓒ,Ⓓ,Ⓔ,Ⓕ,⑦,Ⓘ,㈠,㈡,㈢,㈣,㈤,㈥,㈦,㈧,㈨,㈩,㈪,㈫,㊀,㊁,0,1,2,3,4,5,6,7,8,9,10
[11],[12],[13],[14],[15],[16],[17],ṁ,ś,š,v,〓,╞,う,は,
,↷,↶,ょ,む,♪,〇,幵,ヰ,㐂,ヱ,√,〆,卐,╕
『,└,』,/,˚,、,・,:,└,┘,[,],┐,^, ̄,,⁀,‿,¯,
,
,
,
,,═,_,〝,〟,‖,┌,┐,(
),[,],△,(,(,一,・,▀,日,三,四,五,□
Gemini能识别成这样,实际功力已经很深了。视觉LLM识别文本,最好还是那种成句成文的,因为它们一般是成段成篇文字训练出来的,而不是像传统OCR工具那样一个个字符分割识别。所以给它一个毫无章法的混乱的字符表,通常都是一大片幻觉错误,我刚用它试了试qwen的视觉模型,全篇幻觉或者死循环。
你们用 Gemini Pro 是付费的吗?我看免费额度很少不够 OCR 整本书。
一次调用把额度用足,喂送多少页数,根据64k输出限制倒推,我一般是25或者50页,要看书的每页字数。多备或者借用别人的api key。像Gemini 2.5 Pro当下每天50次的免费调用额度,识别一本书没啥问题。不过Gemini 3 Pro Preview现在没免费api额度了,就用付费的api。想用得舒服,付费api还是需要备一个,比如有时一个文件得多次识别,免费额度很快就用完了。
补一个Textin和Quark的结果,这方面Quark明显更好
Quark:
属呍嘻嗳𡉏壔彀藆摹瀺腊杉柄杻椰棰步汴洎炷焮膀犛狀獐玕疴痤瘭矻
矸确硼窠筩簸簏糗糁鞋縕毅㖈耺萫蔶薏臈薩薯虬蜋螈螭祛裱褊覯跗踠
辶邃邈酴醞釃鐔韛髤魞鮐麽鼯潭莽擁楤丰讆叛疚分
霓㞥灵犰潢襄蔻茴蕈莫葫惝怳膊楉逵檛季箶簺籡箵篼鴘鴹蜹峢蟺𧅵
酸鍉0/0 1 2 3 5 6 7 0 1 0 1 2 3 4 5 6 7 8 9 ./! く・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・
mv~\©⑤をえ○()口ひ秘ーーナⅠⅡ〜…- ?! βce’" "#£É
Ä Åá éí ó à è â ê î ô û ä ëĩ ö üā ē ī ōã ả c ñ~ ~~
ⅡΩαβγδμνπμcωë~[] ∧| Δ蕺曠唳堙燒埵垹搢損
湑澤柞楼標槲橐硯梲撫檉檀梂桀胼腭胳鰧玫琰瑇䵄硑硨磲樱艳箲𥰆簁
笄籍矍箴籙答粏糈䎢蟖蚸蜓蜾螇壍鈸鎺鎩鏼䲃鯎鯎鱩鱩魢鯟鯢䱱
鯷魬鱝鱏鱓子习义㕞厴兔庭遂全离蠃劄嫂愒袅低邙貛攲煤燄氨㤂广癤
眴矕睺毗杼稭皁耮翩舢艘醺跑躇諱諛躻鲲㲯骶䯕鴱鷂𪆒鵇䦕蒴䦕坼
柠祛蟑瘀灵吴鯸鯼䱌𩸽鱲𩺊驎薴艹竹乊丁八分公松総船穴沿盆粉粉翁
聡訟貧鉛雰頌頒@ⓑⒸⓓๆปุ ่直歴動名國医記のぞえろ→⇔ⒶⒷ
©ⒹⒺⒻ⑦①㊀㊁㊂㊃㊄㊅㊆㊇㊈⊕ⓥ戇簀回①2345678910
11⑫⑬⑭⑮⑯⑰ 『ㄴ』/.、・: 二。 - ﹀11(
)△((一· 四五
Textin:
桲祛蛼瘀콧吴鯸鯼魱錵鱲鯇
驎
船沿盆粉紛翁
≠
聡訟貧鉛雰頌頒@b©d
方AB
©DEF⑦イ-ニ三四
67891
111213 14 151617m ś
ホ
✓父卐
『
200
《
『」/
✓
1
)
7
「
1]
I
目】
)
((-·
矻蹺国醑をÉ`擤蓰鮸癤坼
瘭跗噉蟫!!£"撦篇鰭广蕪
座覯嗩孃!仟 槨葓鮞忿蘭
疴褊蜊/”,埵袍鯇秉鴇
ッ④
〔な④
~园は
麞q四가)口
托(团
미因三四
③
他的api是按project走的,ocr不需要上下文都是只调一次的话多开几个project就能一直用。不过错误也会消耗次数,昨天因为cloudflare崩了估计很多人跑到gemini,gemini虽然没崩但一直是overload状态。
我现在正在用gemini识别几本大部头词典。
《法汉大辞典》已经快识别完了
后续准备搞《杜登德汉大辞典》《新世纪日汉双解大辞典》
牛啊,我想过识别《法汉大词典》和杜登,但部头太大,文字校对是不大可能的任务,就放弃了。
付费太贵了,现在基本不写代码了,只是偶尔用下买了浪费。
其实文字什么的现在OCR问题已经不大了,主要是特殊符号识别率低,还有粗体等格式信息不准。法语词典特殊符号用的少,基本ocr后就能直接用,稍微对比改改中文就好。杜登词头有一堆下划线重音符号比较麻烦,但有原版对照应该问题不大。日文感觉最麻烦,特别喜欢用unicode没有的符号,还有一堆小的上标假名识别效果更差。而且有原版的一般还是竖排版识别更麻烦,但日语词典很多有电子化文本,要是没有的话基本就只能手工校对。
你这工作量太大了。新世纪日汉是不是有 app 版?
不做学术性的研究,随便参考看一下,实际对文字错误率的要求并不苛刻。如今有vibe coding的说法,人大多数情况下也是vibe阅读的,扫一眼,主要信息掌握吸引了即可,并不关注细节,不影响大局的小错误都忽略过去了,都没看到。因此大多数文本现在用前沿的OCR工具识别一遍,就可以直接用,并不怎么需要校改。

