成都正達電腦維修服務公司-電話:028-8265510 | 設為首頁
成都正達電腦維修服務公司

服務範圍

聯系方式

聯系人︰丁小姐
電話︰028-8265510
傳真︰028-8265510
郵箱︰

當前位置︰首頁 >> 行業新聞 >> 正文

OCR光學字符識別

編輯︰
摘要︰OCR光學字符識別
OCR(Optical Character Recognition,光學字符識別),是屬于圖型識別(Pattern Recognition,PR)的一門學問。其目的是要讓計算機知道它到底看到了什麼,尤其是文字資料。
OCR的發展︰早在60、70年代,世界各國就開始有OCR的研究,而研究的初期,多以文字的識別方法研究為主,且識別的文字僅為0至9的數字。以同樣擁有方塊文字的日本為例,1960年左右開始研究OCR的基本識別理論,初期以數字為對象,直至1965至1970年之間開始有一些簡單的產品,如印刷文字的郵政編碼識別系統,識別郵件上的郵政編碼,幫助郵局作區域分信的作業;也因此至今郵政編碼一直是各國所倡導的地址書寫方式。
OCR可以說是一種不確定的技術研究,正確率就像是一個無窮趨近函數,知道其趨近值,卻只能靠近而無法達到,永遠在與100%作拉鋸戰。因為其牽扯的因素太多了,書寫者的習慣或文件印刷品質、掃描儀的掃描品質、識別的方法、學習及測試的樣本……等等,多少都會影響其正確率,也因此, OCR的產品除了需有一個強有力的識別核心外,產品的操作使用方便性、所提供的除錯功能及方法,亦是決定產品好壞的重要因素。
一個OCR識別系統,其目的很簡單,只是要把影像作一個轉換,使影像內的圖形繼續保存、有表格則表格內資料及影像內的文字,一律變成計算機文字,使能達到影像資料的儲存量減少、識別出的文字可再使用及分析,當然也可節省因鍵盤輸入的人力與時間。
從影像到結果輸出,須經過影像輸入、影像前處理、文字特征抽取、比對識別、最後經人工校正將認錯的文字更正,將結果輸出。在此逐一介紹︰
影象輸入︰欲經過OCR處理的標的物須透過光學儀器,如影像掃描儀、傳真機或任何攝影器材,將影像轉入計算機。科技的進步,掃描儀等的輸入裝置已制作的愈來愈精致,輕薄短小、品質也高,對OCR有相當大的幫助,掃描儀的分辨率使影像更清晰、掃除速度更增進OCR處理的效率。
影像前處理︰影像前處理是OCR系統中,須解決問題最多的一個模塊,從得到一個不是黑就是白的二值化影像,或灰階、彩色的影像,到獨立出一個個的文字影像的過程,都屬于影像前處理。包含了影像正規化、去除噪聲、影像矯正等的影像處理,及圖文分析、文字行與字分離的文件前處理。在影像處理方面,在學理及技術方面都已達成熟階段,因此在市面上或網站上有不少可用的鏈接庫;在文件前處理方面,則憑各家本領了;影像須先將圖片、表格及文字區域分離出來,甚至可將文章的編排方向、文章的提綱及內容主體區分開,而文字的大小及文字的字體亦可如原始文件一樣的判斷出來。
文字特征抽取︰單以識別率而言,特征抽取可說是 OCR的核心,用什麼特征、怎麼抽取,直接影響識別的好壞,也所以在OCR研究初期,特征抽取的研究報告特別的多。而特征可說是識別的籌碼,簡易的區分可分為兩類︰一為統計的特征,如文字區域內的黑/白點數比,當文字區分成好幾個區域時,這一個個區域黑/白點數比之聯合,就成了空間的一個數值向量,在比對時,基本的數學理論就足以應付了。而另一類特征為結構的特征,如文字影像細線化後,取得字的筆劃端點、交叉點之數量及位置,或以筆劃段為特征,配合特殊的比對方法,進行比對,市面上的線上手寫輸入軟件的識別方法多以此種結構的方法為主。
對比數據庫︰當輸入文字算完特征後,不管是用統計或結構的特征,都須有一比對數據庫或特征數據庫來進行比對,數據庫的內容應包含所有欲識別的字集文字,根據與輸入文字一樣的特征抽取方法所得的特征群組。
對比識別︰這是可充分發揮數學運算理論的一個模塊,根據不同的特征特性,選用不同的數學距離函數,較有名的比對方法有,歐式空間的比對方法、松弛比對法(Relaxation)、動態程序比對法(Dynamic Programming,DP),以及類神經網絡的數據庫建立及比對、HMM(Hidden Markov Model)…等著名的方法,為了使識別的結果更穩定,也有所謂的專家系統(Experts System)被提出,利用各種特征比對方法的相異互補性,使識別出的結果,其信心度特別的高。
字詞後處理︰由于OCR的識別率並無法達到百分之百,或想加強比對的正確性及信心值,一些除錯或甚至幫忙更正的功能,也成為OCR系統中必要的一個模塊。字詞後處理就是一例,利用比對後的識別文字與其可能的相似候選字群中,根據前後的識別文字找出最合乎邏輯的詞,做更正的功能。
字詞數據庫︰為字詞後處理所建立的詞庫。
人工校正︰OCR最後的關卡,在此之前,使用者可能只是拿支鼠標,跟著軟件設計的節奏操作或僅是觀看,而在此有可能須特別花使用者的精神及時間,去更正甚至找尋可能是OCR出錯的地方。一個好的OCR軟件,除了有一個穩定的影像處理及識別核心,以降低錯誤率外,人工校正的操作流程及其功能,亦影響OCR的處理效率,因此,文字影像與識別文字的對照,及其屏幕信息擺放的位置、還有每一識別文字的候選字功能、拒認字的功能、及字詞後處理後特意標示出可能有問題的字詞,都是為使用者設計盡量少使用鍵盤的一種功能。
結果輸出︰看使用者用OCR到底為了什麼。有人只要文本文件作部份文字的再使用之用,只要一般的文字文件、有人要漂漂亮亮的和輸入文件一模一樣,所以有原文重現的功能、有人注重表格內的文字,所以要和Excel等軟件結合。
上一條︰暫時沒有! 下一條︰Windows XP系統進程