技術(shù)領(lǐng)域:
本發(fā)明涉及模式識別與人工智能具體的說,是涉及一種基于卷積神經(jīng)網(wǎng)絡(luò)的數(shù)顯儀表讀數(shù)識別方法。
背景技術(shù):
儀表讀數(shù)的自動識別在各種測量和監(jiān)測系統(tǒng)中具有廣泛的應(yīng)用。例如水電氣熱的抄表計費應(yīng)用中,需要定期讀取儀表讀數(shù)。在監(jiān)測系統(tǒng)中,也需要定期或?qū)崟r地讀取儀表讀數(shù),以實現(xiàn)對系統(tǒng)的監(jiān)測與控制。目前,儀表讀數(shù)的獲取主要有以下幾種方式:(1)在一些應(yīng)用領(lǐng)域,儀表讀數(shù)還主要采用人工讀取的方式,例如水電氣熱數(shù)據(jù)的人工抄表。這種方式費時費力,也不利于系統(tǒng)的自動化。(2)儀表讀數(shù)的自動獲取可以通過對測量儀表數(shù)字化改造,以直接獲取數(shù)字化讀數(shù)。然而,這種方式需要較大的成本投入。例如對現(xiàn)有水表進行數(shù)字化改造,需要拆卸管道并更換數(shù)字化水表,投入較大,也給用戶帶來不便。另外,在一些領(lǐng)域,機械表具有數(shù)字化表難以替代的優(yōu)勢。例如機械水表具有成本低,測量準確,無需電源等優(yōu)勢。(3)基于計算機視覺的讀數(shù)自動識別,通過攝像頭拍攝儀表圖像,利用計算機視覺技術(shù)自動識別儀表讀數(shù)。該方法具有即裝即用,無需改造原有測量儀表,成本低廉等特點。目前,基于計算機視覺的數(shù)顯儀表讀數(shù)自動識別方法,主要采用單字識別的方法,即將讀數(shù)圖像分割為單個的數(shù)字,然后對每個數(shù)字利用傳統(tǒng)分類器(如支持向量機等)進行識別。該方法的不足是,字符分割過程中容易受到圖像噪聲的干擾,產(chǎn)生誤分割,識別準確率也不高。上述缺陷,值得解決。技術(shù)實現(xiàn)要素:為了克服現(xiàn)有的技術(shù)的不足,本發(fā)明提供一種基于卷積神經(jīng)網(wǎng)絡(luò)的數(shù)顯儀表讀數(shù)識別方法。本發(fā)明技術(shù)方案如下所述:一種基于卷積神經(jīng)網(wǎng)絡(luò)的數(shù)顯儀表讀數(shù)識別方法,其特征在于,包括以下步驟:S1:數(shù)據(jù)獲取:采用攝像設(shè)備拍攝包含讀數(shù)區(qū)域的儀表圖像;S2:數(shù)據(jù)處理:通過人工標注方式,對儀表讀數(shù)值進行標注;S3:深度網(wǎng)絡(luò)模型構(gòu)建及訓練:將儀表圖像和相應(yīng)標注數(shù)據(jù)輸入到深度網(wǎng)絡(luò)模型進行訓練,訓練過程中采用殘差回傳算法進行參數(shù)學習;S4:儀表讀數(shù)識別:輸入儀表圖像,深度網(wǎng)絡(luò)模型給出相應(yīng)的儀表讀數(shù)識別結(jié)果和識別置信度。根據(jù)上述方案的本發(fā)明,其特征在于,在所述步驟S1中,拍攝的儀表圖像時,儀表表盤讀數(shù)部分正對鏡頭,居中且占據(jù)圖像面積的三分之二以上。根據(jù)上述方案的本發(fā)明,其特征在于,在所述步驟S2中,標注內(nèi)容為儀表讀數(shù),讀數(shù)的每個數(shù)字之間使用“,”隔開。進一步的,對于正在進位的讀數(shù)位,標注格式為X.5。根據(jù)上述方案的本發(fā)明,其特征在于,在所述步驟S3中,具體包括步驟:S31:構(gòu)建深度神經(jīng)網(wǎng)絡(luò)模型;S32:網(wǎng)絡(luò)模型訓練參數(shù)設(shè)定;S33:對模型參數(shù)進行隨機初始化,然后進行深度神經(jīng)網(wǎng)絡(luò)模型的訓練,得到識別模型。進一步的,在所述步驟S31中,深度神經(jīng)網(wǎng)絡(luò)模型包括特征提取模塊、上下文信息融合模塊和分類模塊:其中,所述特征提取模塊從儀表讀數(shù)圖像中提取數(shù)字特征信息,通過卷積神經(jīng)網(wǎng)絡(luò)得到高級特征圖;所述上下文信息融合模塊根據(jù)高級特征信息,進行上下文信息的融合;所述分類模塊根據(jù)上下文信息模塊對數(shù)字高級特征進行增強,并對讀數(shù)進行分類和預(yù)測。進一步的,在所述步驟S32中,網(wǎng)絡(luò)模型訓練參數(shù)包括迭代次數(shù)、優(yōu)化器、學習率、學習率更新策略以及權(quán)重衰減系數(shù)。更進一步的,所述迭代次數(shù)為1000000,所述優(yōu)化器采用ADADELTA方法,所述學習率為1.0,所述學習率更新策略采用固定不變的學習率,所述權(quán)重衰減系數(shù)為0.0005。進一步的,在所述步驟S33中,訓練過程采用殘差回傳算法進行參數(shù)學習,通過從模型的層開始計算傳遞殘差,并逐層向前傳遞,從而對模型參數(shù)進行更新,以達到網(wǎng)絡(luò)訓練的目的。根據(jù)上述方案的本發(fā)明,其特征在于,在所述步驟S4中,具體包括以下步驟:S41:將儀表讀數(shù)圖像輸入網(wǎng)絡(luò),采用訓練得到的識別模型及參數(shù),對讀數(shù)進行預(yù)測和識別,得到識別結(jié)果;S42:返回識別結(jié)果,并對每一位讀數(shù)的識別置信度進行算術(shù)平均,得到識別置信度。根據(jù)上述方案的本發(fā)明,其有益效果在于:1、與傳統(tǒng)人工抄表相比,本發(fā)明能夠?qū)崿F(xiàn)自動化的儀表讀數(shù)識別,節(jié)省大量人力物力資源,同時在實時性、大批量數(shù)據(jù)處理等方面,具有明顯優(yōu)勢。2、與已有的基于計算機視覺的讀數(shù)自動識別方法相比,本發(fā)明具有以下優(yōu)點:(1)本發(fā)明采用深度網(wǎng)絡(luò)模型結(jié)構(gòu),避免了進行顯式的字符分割、特征提取及字符分類過程。模型能夠從大量數(shù)據(jù)中自動學習數(shù)據(jù)分布,模型更能適應(yīng)真實場景的圖像特點,識別精度更高。(2)本發(fā)明通過殘差反傳算法,自動調(diào)整卷積核,得到更魯棒的濾波器,能夠應(yīng)對模糊、透視變換、光線變換等復(fù)雜的實際應(yīng)用場景。附圖說明圖1為本發(fā)明的整體流程框圖。圖2為本發(fā)明深度網(wǎng)絡(luò)模型的結(jié)構(gòu)示意圖。圖3為本發(fā)明數(shù)顯儀表讀數(shù)識別實例的示意圖。具體實施方式下面結(jié)合附圖以及實施方式對本發(fā)明進行進一步的描述:如圖1所示,一種基于卷積神經(jīng)網(wǎng)絡(luò)的數(shù)顯儀表讀數(shù)識別方法,包括數(shù)據(jù)獲取、數(shù)據(jù)處理、深度網(wǎng)絡(luò)模型構(gòu)建及訓練以及儀表讀數(shù)識別等過程。一、數(shù)據(jù)獲?。翰捎檬謾C、專用硬件等攝像設(shè)備拍攝儀表表盤圖像。拍攝過程中,儀表表盤讀數(shù)部分正對鏡頭,居中且占據(jù)圖像面積的三分之二以上,儀表表盤允許一定程度傾斜,但讀數(shù)區(qū)域需要拍攝完整。所拍攝的儀表圖像應(yīng)涵蓋不同規(guī)格的待檢測儀表,儀表圖像數(shù)量不少于100000張。二、數(shù)據(jù)處理:對拍攝的圖像進行標注,標注內(nèi)容為儀表讀數(shù),讀數(shù)的每個數(shù)字之間使用“,”隔開,標注內(nèi)容無需包含任何坐標信息。其中,對于正在進位的讀數(shù)位,標注格式為X.5,例如某讀數(shù)位的值介于7和8之間,則需要標注為“7.5”。每位共有0-9即10個數(shù)字狀態(tài),加上進位狀態(tài),則每位共存在20類標注狀態(tài)。三、深度網(wǎng)絡(luò)模型構(gòu)建及訓練:將儀表圖像和相應(yīng)標注數(shù)據(jù)輸入到深度網(wǎng)絡(luò)模型進行訓練,訓練過程中采用殘差回傳算法進行參數(shù)學習。具體包括以下步驟:1、構(gòu)建深度神經(jīng)網(wǎng)絡(luò)模型如圖2所示,所構(gòu)建的深度神經(jīng)網(wǎng)絡(luò)模型包括特征提取模塊模塊、上下文信息融合模塊和分類模塊模塊。其中,特征提取模塊從儀表讀數(shù)圖像中提取數(shù)字特征信息,通過卷積神經(jīng)網(wǎng)絡(luò)得到高級特征圖;上下文信息融合模塊根據(jù)高級特征信息,進行上下文信息的融合;分類模塊根據(jù)上下文信息模塊對數(shù)字高級特征進行增強,并對讀數(shù)進行分類和預(yù)測。(1)特征提取模塊結(jié)構(gòu)為:網(wǎng)絡(luò)層具體操作特征圖尺寸輸入層-3×40×144卷積層核數(shù)量64,卷積核3×3,步長1×1,補邊64×40×144非線性層-64×40×144池化層池化核2×2,步長2×264×20×72卷積層核數(shù)量64,卷積核3×3,步長1×1,補邊64×20×72非線性層-64×20×72池化層池化核2×2,步長2×264×10×36卷積層核數(shù)量128,卷積核3×3,步長1×1,補邊128×10×36非線性層-128×10×36池化層池化核2×1,步長2×1128×5×36卷積層核數(shù)量128,卷積核2×2,步長1×1128×4×35非線性層-128×4×35卷積層核數(shù)量256,卷積核3×3,步長1×1,補邊256×4×35非線性層-256×4×35池化層池化核2×2,步長2×2256×2×18卷積層核數(shù)量512,卷積核2×2,步長1×1512×1×17歸一化層-512×1×17非線性層-512×1×17如上表所示,特征提取模塊中,卷積層的貼邊操作運算為,在原特征圖的上下左右均貼上一圈像素點,像素值為0;非線性層采用ReLU激活函數(shù);池化層采用池化方式;歸一化層將每一張?zhí)卣鲌D歸一化為高斯正態(tài)分布。(2)上下文信息融合模塊結(jié)構(gòu)為:網(wǎng)絡(luò)層具體操作特征圖尺寸長短時記憶層結(jié)點數(shù)128128×1×17長短時記憶層結(jié)點數(shù)256256×1×17如上表所示,上下文信息融合模塊中,長短時記憶層為LSTM模型結(jié)構(gòu)。(3)所采用的分類模塊結(jié)構(gòu)為:網(wǎng)絡(luò)層具體操作特征圖尺寸全連接層結(jié)點數(shù)256256×1×17全連接層結(jié)點數(shù)256256×1×17全連接層結(jié)點數(shù)2121×1×17如上表所示,分類模塊采用具有17個位置的預(yù)測結(jié)構(gòu),將預(yù)測結(jié)果進行CTC(ConnectionistTemporalClassification)解碼,得到儀表讀數(shù)的識別結(jié)果。上述的特征提取模塊、上下文信息融合模塊和分類模塊均使用了深度網(wǎng)絡(luò)模型,表格中的神經(jīng)網(wǎng)絡(luò)層為順序連接形式,采用殘差回傳算法更新神經(jīng)網(wǎng)絡(luò)中的參數(shù)。其中:特征提取模塊的輸入為儀表讀數(shù)圖像,輸出為高級特征圖,并作為上下文信息融合模塊的輸入;上下文信息融合模塊的輸出為上下文信息的融合特征圖,并作為分類模塊的輸入;分類模塊的輸出為17個位置的預(yù)測結(jié)果,并進行CTC(ConnectionistTemporalClassification)解碼。3個模塊均使用監(jiān)督學習方法,通過訓練,學習得到數(shù)字圖像特征和標簽的映射關(guān)系。2、訓練參數(shù)的設(shè)定:迭代次數(shù):1000000;優(yōu)化器:采用ADADELTA方法;學習率:1.0;學習率更新策略:采用固定不變的學習率;Weightdecay(權(quán)重衰減系數(shù)):0.0005。3、對模型參數(shù)進行隨機初始化,然后進行深度神經(jīng)網(wǎng)絡(luò)模型的訓練,得到識別模型。訓練過程采用殘差回傳算法進行參數(shù)學習,通過從模型的層開始計算傳遞殘差,并逐層向前傳遞,從而對模型參數(shù)進行更新,以達到訓練網(wǎng)絡(luò)的目的。四、儀表讀數(shù)識別儀表讀數(shù)識別過程具體包括:(1)將一張儀表讀數(shù)圖像輸入網(wǎng)絡(luò),采用訓練得到的識別模型及參數(shù),對對數(shù)進行預(yù)測和識別,得到識別結(jié)果;(2)返回識別結(jié)果,并對每一位讀數(shù)的識別置信度進行算術(shù)平均,得到識別置信度。如圖3所示,其顯示了數(shù)顯儀表讀數(shù)的識別結(jié)果與置信度。其中,左列為識別結(jié)果,包括了讀數(shù)識別結(jié)果、識別置信度,右列為儀表讀數(shù)的圖像。本發(fā)明采用整體識別方法,無需對讀數(shù)中數(shù)字進行顯式分割,具有較高的識別性能。實際測試中,本發(fā)明的方法可以達到99.0%的識別準確率,識別速度為每張儀表讀數(shù)圖像不超過30毫秒,可以滿足實際應(yīng)用的需要。本發(fā)明一方面有效利用了深度網(wǎng)絡(luò)模型的特征學習能力和分類性能,同時可以更為有效地發(fā)現(xiàn)隱藏于大量儀表圖像數(shù)據(jù)中的數(shù)據(jù)特征,從而實現(xiàn)一種高精度的儀表讀數(shù)自動識別方法。本發(fā)明具有較好的實際應(yīng)用價值,可以廣泛應(yīng)用于涉及儀表讀數(shù)識別的領(lǐng)域,如水、電、氣、熱等各種計量表讀數(shù)的自動識別中。應(yīng)當理解的是,對本領(lǐng)域普通技術(shù)人員來說,可以根據(jù)上述說明加以改進或變換,而所有這些改進和變換都應(yīng)屬于本發(fā)明所附權(quán)利要求的保護范圍。上面結(jié)合附圖對本發(fā)明進行了示例性的描述,顯然本發(fā)明的實現(xiàn)并不受上述方式的限制,只要采用了本發(fā)明的方法構(gòu)思和技術(shù)方案進行的各種改進,或未經(jīng)改進將本發(fā)明的構(gòu)思和技術(shù)方案直接應(yīng)用于其它場合的,均在本發(fā)明的保護范圍內(nèi)。