如果」重新尋找一張桌子,可以讓你根據視覺相似性計算出一種「重置成本」,但我一直在尋找這樣的事情一段時間沒有成功,所以我開始將它視爲一個新問題。我沒有使用OCR,但是我正在尋找一種方法來限制搜索參數,在錯誤類型字符的概率搜索。由於人類在視覺上混淆了角色,因此錯誤輸入,因此同樣的原則也適用於您。
我的方法是根據字母在8位字段中的筆畫分量對字母進行分類。的位,從左到右依次爲:
7: Left Vertical
6: Center Vertical
5: Right Vertical
4: Top Horizontal
3: Middle Horizontal
2: Bottom Horizontal
1: Top-left to bottom-right stroke
0: Bottom-left to top-right stroke
對於小寫字符,左側下伸被記錄在比特1,並且在第0位的權利,對角線下伸。
使用該方案,我想出了以下值,它們試圖根據視覺相似性排列字符。
m: 11110000: F0
g: 10111101: BD
S,B,G,a,e,s: 10111100: BC
R,p: 10111010: BA
q: 10111001: B9
P: 10111000: B8
Q: 10110110: B6
D,O,o: 10110100: B4
n: 10110000: B0
b,h,d: 10101100: AC
H: 10101000: A8
U,u: 10100100: A4
M,W,w: 10100011: A3
N: 10100010: A2
E: 10011100: 9C
F,f: 10011000: 98
C,c: 10010100: 94
r: 10010000: 90
L: 10000100: 84
K,k: 10000011: 83
T: 01010000: 50
t: 01001000: 48
J,j: 01000100: 44
Y: 01000011: 43
I,l,i: 01000000: 40
Z,z: 00010101: 15
A: 00001011: 0B
y: 00000101: 05
V,v,X,x: 00000011: 03
這一點,因爲它的立場,是我的目的,太原始了,需要更多的工作。但是,您也許可以使用它,或者也可以調整它以適應您的目的。該計劃相當簡單。這個排名是針對單一空間字體的。如果您使用的是無襯線字體,則可能需要重新處理這些值。
該表格是一個包含所有字符(大寫和小寫)的混合表格,但是如果僅將其分成大寫字母和小寫字母,則它可能證明更有效,並且還可以應用特定套管罰款。
請記住,這是早期的實驗。如果你看到一種方法來改進它(例如通過改變位排序),盡一切辦法來做到這一點。
它可以是非常具體的,你正在使用的成像機和OCR程序本身。最佳策略,恕我直言,是創建一個訓練數據集,並憑經驗計算這些概率。 – ElKamina