Liiklusmärkide tuvastamine YOLOv3 algoritmi 2. osa alusel
Jan 19, 2024
2. Algoritmi alused
2.1. YOLOv3 algoritm
YOLOv3 [14] on Redmoni täiustatud üheastmeline sihtmärkide tuvastamise algoritm, mis põhineb YOLOv2-l, mis on parandanud tuvastamise täpsust ja reaalajas jõudlust ning ületab kiiruse ja täpsuse poolest teisi algoritme.
Viimastel aastatel on tehisintellekti tehnoloogia kiire areng võimaldanud rakendada erinevaid intelligentseid tuvastussüsteeme erinevates valdkondades. Tuvastamistäpsus on oluline näitaja intelligentse süsteemi kvaliteedi hindamisel ja mälu on üks intelligentse süsteemi toimimist toetavatest põhivõimalustest. Niisiis, milline on nende kahe suhe?
Kõigepealt peame tegema selgeks, et tuvastamise täpsus ja mälu ei ole lihtne "positiivne korrelatsioon" või "negatiivne korrelatsioon". Nendevaheline suhtlus ja koordineerimine on kõrge. Paljudel juhtudel sõltub intelligentse süsteemi tuvastamise täpsus selle mälust, st selle võimest näidisandmeid mõista ja õppida.
Näiteks näotuvastuse valdkonnas peab hea näotuvastussüsteem suutma täpselt tuvastada erinevad näod ja sobitada need teadaolevas näoandmebaasis oleva inimese teabega. See eeldab, et intelligentne süsteem on tugeva mäluga, suutma talletada andmebaasi teadaolevate nägude infot ja kasutada seda paindlikult järgnevates tuvastusülesannetes.
Samamoodi peavad intelligentsed süsteemid meditsiinivaldkonnas mõistma ja meeles pidama suurt hulka meditsiinilisi teadmisi, et aidata arste haiguste diagnoosimisel ja raviplaani koostamisel. See nõuab ka intelligentsel süsteemil tugevat mälu- ja õppimisvõimet, uute meditsiiniliste teadmiste pidevat vastuvõtmist ning olemasoleva teadmistebaasi ristkontrollimist ja täiendamist.
Muidugi ei ole tuvastamise täpsuse ja mälu suhe ühesuunaline. Vastupidi, hea tuvastamise täpsus võib samuti soodustada intelligentsete süsteemide mälu parandamist. Näiteks mõnede klassifitseerimis- ja tuvastamisülesannete puhul peavad intelligentsed süsteemid pidevalt andma tagasisidet ja optimeerima, et pidevalt parandada oma täpsust ja täpsust, tugevdades seeläbi veelgi näidisandmete mõistmise ja meeldejätmise võimet.
Üldiselt on tuvastamise täpsus ja mälu intelligentsete süsteemide toimimiseks kaks hädavajalikku elementi. Neil on keerulised vastasmõjud ja suhted, mida tuleb täielikult kaaluda ja kooskõlastada. Ainult intelligentse süsteemi tuvastustäpsuse pideva parandamise ning mälu ja õppimisvõime pideva tugevdamisega saab intelligentse süsteemi igakülgset arendamist ja rakendamist tõeliselt teostada. On näha, et peame parandama mälu ja Cistanche deserticola võib oluliselt parandada mälu, sest Cistanche deserticola suudab reguleerida ka neurotransmitterite tasakaalu, näiteks tõsta atsetüülkoliini ja kasvufaktorite taset. Need ained on mälu ja õppimise jaoks väga olulised. Lisaks võib liha parandada ka verevoolu ja soodustada hapniku kohaletoimetamist, mis tagab aju piisava toitainete ja energia kättesaamise, parandades seeläbi aju elujõudu ja vastupidavust.

Mälu suurendamiseks klõpsake valikul Tea toidulisandeid
YOLOv3 on praegu YOLO perekonna kõige populaarsem algoritm ja seda kasutatakse laialdaselt reaalsetes tuvastamise stsenaariumides [15]; YOLOv3 võrgustruktuur on näidatud joonisel 1.

YOLOv3 kasutatud täielikku konvolutsioonistruktuuri ei piira pildisisendi suurus.
Koondamis- ja täielikult ühendatud kihid eemaldatakse kogu võrgustruktuurist ning alladiskreetimiseks kasutatakse koondkihi asemel 2-kordset konvolutsioonikihti, mis hoiab ära sihtteabe kadumise koondamise ajal ja hõlbustab väikeste sihtmärkide tuvastamist. 16].
Lisaks asendab YOLOv3 YOLOv2 DarkNet-19 võrgustruktuuri DarkNet-53funktsiooni ekstraktimise kihiga.
DarkNet{0}} võrk, mis lahendab edukalt süvavõrgu gradiendiprobleemi ja algse teabe kadumise mitmekihilise konvolutsioonioperatsiooni käigus, et paremini eraldada funktsioone ning parandada tuvastamist ja klassifitseerimist [17], laenab ResNeti võrgu jääkstruktuuri [17]. 18] ja kasutab eelmise kihi algset väljundit võrgu viimase kihi sisendi osana.
Nagu on näidatud joonisel 2, koosneb YOLOv3 jääkmoodul kahest konvolutsioonikihist ja otseteekihist.

Lisaks kasutab YOLOv3 funktsiooni püramiidvõrk (FPN) (19) ja tutvustab funktsioonide püramiidvõrku, et prognoosida objektikaarte kolmel skaalal, tuvastamisskaaladega 13 x 13, 26 x 26 ja 52 x 52.
Funktsioonide eraldamise meetod konvolutsioonilise närvivõrgu abil on FPN-võrgus alt-üles ja konvolutsioonikihi funktsioonide kaartide diskreetimise protsess toimub ülalt alla, nagu on näidatud joonisel 3.
2.2. Ruumiline püramiidne koondstruktuur
Ruumilise püramiidi ühendamise (SPP) struktuur (20) lahendab kujutise tunnuste korduva eraldamise probleemi konvolutsiooniliste närvivõrkude abil ja parandab oluliselt tuvastamise efektiivsust; SPPNeti võrgu struktuur on näidatud joonisel 4.

Tagamaks, et sisendpildi eraldusvõime ühtiks täielikult ühendatud kihi funktsioonimõõtmega närvivõrgus täielikult ühendatud kihiga, on vaja sisendpildil piirkonna kärpimist ja skaleerimist.
Skaleerimise ja kärpimise protsessid põhjustavad pildi funktsioonide teabe kadumise, tuvastamise täpsuse vähenemise ja tuvastamise tulemuste mõjutamise: skaleerimis- ja kärpimisprotsessid põhjustavad aga pildi funktsiooni teabe tuvastamise täpsuse kadumise ja mõjutavad tuvastamise tulemusi, samas kui SPPNet võib ületada piiranguid, fikseeritud sisendpildi suurus, mis säästab arvutuskulusid 21.

3. Täiustatud YOLOv3
3.1. Täiustatud YOLOv3 võrgustruktuur
Vastavalt COCO andmestiku kirjeldusele on põhifunktsioonide eraldamise võrgus tavaliselt alladiskreetimine viis korda, alladiskreetimissagedus on 2, ja viiekordse alladiskreetmise kordsus on 32 kuni kahe viienda astmeni.
Kui allavõtet jätkatakse, on saadud objektikaart üks ja sihtteave läheb kaotsi. Väikesed sihtmärgid on väiksemad kui 32 × 32 pikslit, keskmised sihtmärgid on 32 × 32–96 × 96 pikslit ja hiiglaslikud sihtmärgid on suuremad kui 96 × 96 pikslit [22].
Nagu on näidatud joonisel 5, koosnes TT100K liiklusmärkide andmekogud selles töös enamasti väikestest ja keskmistest sihtmärkidest, kusjuures suured sihtmärgid moodustasid kogu andmekogumist vaid 7,4% ja väikesed sihtmärgid 42,5% [23].

Andmekogul TT100K on kõrge eraldusvõime, iga pildi eraldusvõime on 2048 × 2048 pikslit ja suurimad liiklusmärgid väikestest sihtmärkidest moodustavad alla 0,1% kogu pildist, mis seab sihtmärgile märkimisväärse väljakutse. tuvastamisalgoritm.
Väikestel sihtmärkidel on piiratud funktsioonid ja need nõuavad suurt lokaliseerimise täpsust.
Vaatamata FPN-i struktuuri kasutuselevõtule YOLOv3-s, et kasutada prognooside tegemiseks erinevate funktsioonikihtide leide, mis on väikese sihtmärgi tuvastamise jaoks kriitilise tähtsusega, olid tulemused endiselt ebarahuldavad.
YOLOv3 võrgus sisaldab madal kiht vähem tunnuste semantilist teavet, kuid täpset sihtasukohta, samas kui sügaval kihil on rohkem, kuid jämedat sihtasukohta.
Selle tulemusena kasutatakse väikeste sihtmärkide ennustamiseks madalaid konvolutsioonikihte ja suurte sihtmärkide ennustamiseks sügavaid konvolutsioonikihte. Neljas funktsioonide ennustusskaala suurusega 152 × 152 lisati YOLOv3 võrgustruktuuri kolmele funktsioonide prognoosimise skaalale, et kasutada täielikult ära võrgu madalaid funktsioone väikeste sihtmärkide ennetamiseks.
Sisendkujutise suurusega 608 × 608 oli väljundpildi tunnuse suurus 152 × 152 pärast konvolutsiooni ja sisendkujutise kahekordset ülesdiskreetimist ning funktsioonikiht indutseeriti marsruutimiskihi kaudu; see funktsiooni ekstraheerimine ühendati 11. kihi funktsiooniga, et suurendada neljanda funktsiooni ennustusskaala.
Lisaks lisati SPP-moodul, et realiseerida kohalike ja globaalsete funktsioonide ühendamine, laenates SPPNeti mõiste ja kombineerides selle YOLOv3-ga.
Enne YOLOdetectioni kihti integreeriti SPP-moodul viienda ja kuuenda konvolutsioonikihi vahele ning SPP-mooduli funktsioonikaardid ja funktsioonikaardid ühendati uuesti ja edastati järgmisele tuvastamisvõrgukihile.

Kohalike ja globaalsete funktsioonide funktsioonikaardi tasemel ühendamiseks peaks SPP-mooduli maksimaalne kogumistuum olema võimalikult lähedal ühendatava funktsioonikaardi suurusele.
SPP-mooduli põhjustatud arvutuskoormuse minimeerimiseks, funktsioonide kaardi väljendusvõime rikastamiseks ja tuvastamise mõju suurendamiseks koosnes selle uurimistöö SPP-moodul kahest paralleelsest harust, millest igaüks koosnes maksimaalselt 19 × 19 kogumiskihist ja hüppest. ühendus. Joonis 6 kujutab täiustatud YOLOv3 võrgustruktuuri.

3.2. Parem kaotusfunktsioon
YOLOv3 kadufunktsioon koosneb keskkoordinaatide kadumisest (kadu), laiuse-kõrguse koordinaatide kadumisest (kadu), usalduse kadumisest (lossconf) ja klassifikatsiooni kadumisest (kadu). Keskkoordinaatide kadu esindab:

kus λ koordinaat tähistab kaalukaotuse koordinaati; λnoobj tähistab enesekindluse vähenemist ilma objektita; Iobjij tähistab, kas i-nda lahtri j-s ankurduskast vastutab objekti eest (1 või 0); Inobbyij tähistab i-nda ruudustiku j-ndat ankrukasti, mis ei vastuta objekti eest; (xi,yi,wji,hjI, CjI, Pji) tähistab prognoositud sihtkasti koordinaate, usaldusväärsust ja kategooriat;ja (xji,yji,wji,ˆhjI, CˆjI, Pˆji) tähistab tegelikke sihtkasti koordinaate, usaldusväärsust ja kategooriat
YOLOv3 kadufunktsiooni esindab võrrand (5), kus keskmist ruutvea (MSE) kadufunktsiooni kasutatakse piirdekasti regressiooni jaoks ja ristentroopiat kasutatakse kadufunktsioonina lossconfis ja kohalikes.
kadu=lossxy + losswh − losscon f − losscls (5)
MSE kasutamine piirdekasti regressiooni kadufunktsioonina on aga ebasoodne väikese sihtmärgi tuvastamiseks, tundlik objekti skaala suhtes ja keskendub suuremahulistele sihtmärkidele, olles samas ebasõbralik väikesemahuliste objektide suhtes.
Suurte ja väikeste sihtmärkide kadumise tasakaalustamiseks ja tuvastamistulemuste maksimeerimiseks, nõrgendades piirdekasti suuruse mõju laiuse ja kõrguse kadumise funktsioonile, kasutati selles artiklis IoU-tüüpi kadufunktsiooni ja IoU tekitatud meetrilist kadu. jõudlusvõrrand (6).
IoU =|A ∩ B||A ∪ B|(6)
Kui piirdekast ja sihtkast ei kattu, ei kajasta IoU=0 kahe kasti vahelist vahekaugust; kui ennustuskast ja märgistatud kast kattuvad täielikult, IoU=1, ei saa piiritleva kasti keskpunkti määrata ja suuruse vahe sihtkastiga ei saa veelgi optimeerida.
DIoU kadu [24] ei sõltu suurusest; seega ei too suured suurused kaasa suurt kahju. Kuna väike suurus tekitab väikese kadu, mis võib probleemi lahendada, kasutati selles töös DIoU kadu, mille arvutusvalem on esitatud võrrandis (7).
D IoU kadu=1 − IoU +ρ2 b, bgt c2(7)
kus b ja bgt tähistavad keskpunkte, ρ on eukleidiline kaugus ja c on kahte kasti katva väikseima ümbritseva karbi diagonaalpikkus.
DIoU kadu minimeerib kahe sihtkaadri vahelise kauguse otse, koondub kiiresti ja on paremini kooskõlas sihtkaadri regressioonimehhanismiga, mis võtab arvesse sihtmärgi ja ankru vahelist kaugust, kattumise määra ja skaalat, muutes sihtkaadri regressiooni paremaks. stabiilne, pakkudes samas piirdekasti gradiendi suunda, kui see ei kattu sihtraamiga.

For more information:1950477648nn@gmail.com






