Uudne ruumilis-ajaline pidev viipekeele tuvastamine, kasutades tähelepanelikku mitme funktsiooniga võrku (2)

Jun 01, 2023

3.5. Järjestusõpe

Järjestuste õppimine Pärast tulemuste saamist ruumiliste ja ajaliste tunnuste eraldajast läiketunnusena, peame need terviklauseks korraldama. Seetõttu peame kasutama järjestusõpet tagamaks, et läige õnnestub moodustada hea lause. Praeguses uurimistöös levinuim meetod viitab kahesuunalisele pika lühiajalisele mälule (Bi-LSTM) ja konneksionistlikule ajalisele klassifikatsioonile (CTC) [17, 23] probleemide jaoks, mida saab lahendada CTC abil, ning mitmed hiljutised tööd [17, 23] pakuvad välja CTC kui CSLR-i täielik koolitusprotsess.

cistanche extract powder

Cistanche ekstrakti pulber

Cistanche toodete vaatamiseks klõpsake siin

【Küsi lisa】 E-post:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Pikaajaline lühiajaline mälu (LSTM) [44] on korduva närvivõrgu (RNN) variant ja seda kasutatakse laialdaselt järjestuste modelleerimisel. LSTM modelleerib suurepäraselt pikaajalisi sõltuvusi; see suudab töödelda terveid sisendite jadasid ja kasutada nende sisemist olekut olekuüleminekute modelleerimiseks. Nende edasiste RNN-ide puuduseks on aga see, et peidetud olekuid õpitakse ainult ühesuunalisest suunast. Pärast funktsioonijada sisendiks saamist loob RNN peidetud oleku, nagu on kirjeldatud alloleva võrrandiga.

ht=RNN(ht−1,ot),

kus ht tähistab peidetud olekut, kus algolek h0 on fikseeritud nullist koosnev vektor ja t on ajasamm. RNN-i kasutatakse märkide läigete ennustamiseks vastavalt ruumiliste tunnuste jada sisendile.

Lisaks on SL-ülesanded üsna keerulised. Seetõttu ei nõua see mitte ainult ühesuunalisest kontekstist saadud tunnuseid, vaid vajab ka abi kahesuunalise teabe kasutamisel, et õppida tundma sõnade esinemist, mis esinevad lauses enne ja pärast teisi sõnu. Sellest tulenevalt kasutame Bi-LSTM-i [45], et õppida pildijadade keerulisi dünaamilisi sõltuvusi, muutes need ruumiliste ja ajaliste esituste abil läikeomaduste järjestusteks. Varem öeldud selgituse kohaselt saab Bi-LSTM meetodil LSTM meetodil teha kahesuunalist tööd. See tähendab, et Bi-LSTM meetod suudab järjestikuseid andmeid paremini klassifitseerida. Bi-LSTM-i arvutamist, mis kasutab kahesuunalisi peidetud olekuid, võib vaadelda ka LSTM-i korduvate arvutustena, mida töödeldakse eest taha ja seejärel tagant ette. Seejärel lastakse iga ajaetapi peidetud olek läbi täielikult ühendatud kihi ja softmax kihi [17].

cistanche powder

Cistanche pulber

kell=W(ht pluss b),

yt,j=e at,j ∑ke at,j ,

kus b on nihkevektor ja y(t,j) tähistab märgise j tõenäosust ajaetapis t. Meie TSL-i ülesandes on silt j sõnavara, mis saadakse lausest. Praktikas parandab Bi-LSTM oluliselt teabe hulka, millele võrk pääseb juurde, mis omakorda parandab algoritmis saadaoleva teabe konteksti. Teave sisaldab teadmist selle kohta, milline sõna tuleb lausetunnusjada sisendis pärast või enne praegust kaadrit.

Bi-LSTM saadab peidetud olekud väljundina CTC-kihile iga ajaetapi kohta. Kuna selle Bi-LSTM-i tulemused ei pööra tähelepanu läikepaigutusele, kasutame märgi loomiseks videojärjestuse kaardistamiseks CTC-d o={ot} T 0 t=1 läikejada `={` i} IL =1 (L Väiksem kui T või sellega võrdne) parema paigutusega. CTC-d kasutatakse paljudes valdkondades, sealhulgas käekirjatuvastuses [46], kõnetuvastuses [47] ja viipekeele tuvastamises [17,23]. Selles domeenis kasutatakse seda punktifunktsioonina ilma sisend- ja väljundjadasid joondamata. CSLR-is tuntakse CTC-d moodulina, mis on välja töötatud täielike ülesannete jaoks, mis hõlmavad ajaandmete klassifitseerimist ilma segmenteerimiseta. Dünaamilise programmeerimise abil saab CSLR lahendada joondusprobleemi, luues tühja sildi (-), mis võimaldab süsteemil toota optimaalseid tulemusi selliste andmete esitamiseks, millel pole silte (nt epenteesiandmed ja mittežestiandmete segmendid). Täpsemalt, CTC genereerib sõnavara V laiendamiseks tühja sildi "-", kus V=Voorigin ∪ {-}. Selle tühja sildi eesmärk on kujutada üleminekut ja teavitada tühja läike olemasolust, mis ei anna õppeprotsessi jaoks teavet, kuna π={πt} T 0 t{{20 }}, kus πt ∈ V. Selle tulemusel saab CTC hallata ruumilise ja ajalise tunnuse ekstraktori väljundparameetreid ning joondusmoodulina ka Bi-LSTM-i, võttes kokku kõigi võimalike teede tõenäosused. Kõigil joondusteel π on tõenäosus, mis antakse järgmiselt [17]:

Cistanche deserticola experiment

Cistanche deserticola eksperiment

p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, πt

Järgmises etapis määratleme mitu-ühele vastendamise operatsiooni B, mis eemaldab tühja ruumi ja dubleerib joondusteelt sõnu. Näiteks B (II-am- -a- -doctor)=I, am, a, arst. Selle tulemusel saame arvutada märgi läikejada l tingimusliku tõenäosuse kõigi marsruutide tõenäosuste summana, mida saab vastendada l-le B-st allpool kirjeldatud viisil [17]:

p(π|o) = ∑ π∈B−1 p(π|o)

kus B −1 (l)={π|B(π)=l} on B pöördtehte. Lõpuks määratletakse tunnusjada CTC-kaod järgmiselt [17]:

Lctc=− ln p(` |o)

Tingimusliku tõenäosuse p(π|X) saab arvutada tingimusliku sõltumatuse eelduse järgi.

4. Katsetulemused ja arutelu

cistanche—Improve memory2

Cistanche toidulisand minu lähedal - parandage mälu

Selles jaotises selgitame meie katse üksikasju kavandatud konfiguratsiooniga, nagu on selgitatud eelmises jaotises.

4.1. Andmekogumid

Selles jaotises selgitame andmekogumeid, mida selle katse ajal kasutasime. Kasutasime kahte andmekogumit, esimene on CSL-i andmestik [8, 40, 41] ja teine ​​​​andmestik RWTH-PHOENIX [33, 39]. Mõlemad andmestikud on pidevad viipekeele andmestikud, mida kasutatakse mõne žestide seeria tõlkimiseks täislauseks.

4.1.1. CSL-i andmestik

CSL-i andmestikku on kasutanud mitmed tööd [8,40,41]. Selles andmekogumis on kokku 100 lauset ja 178 sõna, mida igapäevases suhtluses tavaliselt kasutatakse. See andmestik sisaldab keskmiselt 5 sõna lause kohta. Iga lause sooritas 50 allkirjastajat 5 korda. Seega on videote koguarv 25 000, mis teeb sellest ühe suurima andmekogumi. CSL-mudeli koolitamiseks jagasime andmestiku andmeteks, mis on ette nähtud 20,{11}} videoga treenimiseks ja 5000 sama lausega, kuid erinevate allkirjastajatega videoga testimiseks.

4.1.2. Andmekogum RWTH-PHOENIX

Andmestik RWTH-PHOENIX [33,39] on saksa viipekeelne andmestik, mis on Saksamaa telejaamade avalike ilmateadete salvestis. See video on töödeldud nii, et selle suurus on 210 × 260. Seal on 6841 erinevat lauset, millele on alla kirjutanud 9 erinevat allkirjastajat. Kõik allakirjutanud kandsid heledal taustal tumedaid riideid. Kokku on 1232 sõna umbes 80,{11}} glossidega. See andmestik on jagatud vastavalt etteantud vormingule, mis koosneb 5672 koolitusnäidisest, 540 valideerimise/arenduse näidisest ja 629 testnäidisest.

4.2. Andmete eeltöötlus

Esimene asi, mida pidime tegema, oli andmestiku eeltöötlemine, et see sobiks meie pakutud mudeliga. Teostasime suuruse muutmise ja kärpimise, nagu on näidatud joonisel 3; vasakpoolsel küljel näeme, et algandmete suurus oli täis-HD või eraldusvõimega 1920 × 1080. Peame selle kärpima ja muutma selle eraldusvõimeks 224 × 224, kuna meie ruumimoodul saab sisendit, mis on sama suur kui ResNet50 sisend. Pärast seda sisestasime andmed oma ruumimudelisse, mis toodaks ühest pildist 7 × 7 tensori.

Seejärel kasutati eeltöödeldud täiskaadri kujutist võtmepunkti funktsioonide genereerimiseks. Nende RGB-piltide 133 võtmepunkti ennustamiseks kasutasime HRNeti mudelit. Siiski kasutame oma pakutud mudelis ainult 27 ülakeha võtmepunkti. Võtmepunkti funktsioonide sisendsuurus on 27 × 3, kuna meil on 3-telje (x, y ja z) koordinaadiandmed punkti kohta. Mudeli sisendmõõde on täiskaadri funktsiooni puhul N × 224 × 224 × 3 ja võtmepunkti sisendi puhul N × 1 × 27 × 3, kus N on kaadrite arv. Andmestiku varieerumise suurendamiseks järgime [12] suurendamist, sealhulgas juhuslikku kärpimist, horisontaalset ümberpööramist ja juhuslikku ajalist skaleerimist. Juhuslikku kärpimist kasutatakse ka eeltöötlusetapi osana algse pildi kärpimiseks.

cistanche—Improve memory7

Cistanche toidulisand minu lähedal - parandage mälu

4.3. Hindamise mõõdik

Meie pakutud mudeli tuvastamise toimivuse hindamiseks kasutame sõna veamäära (WER) mõõdikut, mis on tavaliselt CSLR-is kasutatav mõõdik ennustatud lause tuvastamise täpsuse hindamiseks, nagu on näidatud alloleva võrrandiga [17]:

WER=S pluss I pluss DT=S pluss I pluss DS pluss C plus D

kus S on algse sõna asenduste arv, I on sisestuste arv, mida pole algses lauses, D on kustutamiste arv, mis oleks pidanud olema algses lauses, C on õigete sõnade arv, mis vastavad algne lause ja T on sõnade koguarv lauses või mille saab saada asenduste, kustutamiste ja õigete sõnade koguarvust. CSL-i puhul kasutatakse iga tähemärki sõna tähistamiseks.

4.4. Katsetage sisendvoogudega

See katse keskendub peamiselt meie mudeli ühe- ja mitmevoolise sisendi võrdlemisele. Eesmärk on leida sisendvoo parim konfiguratsioon. Selles katses kasutame ainult RWTH-PHOENIX andmekogumit. Meie mudel saaks kaks eraldi sisendit, täiskaadri ja võtmepunkti sisendi. Ühevooline sisend kasutab täiskaaderpildilt ainult RGB-funktsiooni. On kaks ühe vooga sisendkatset. Esimene kasutab ainult täiskaadri funktsiooni RGB-pildilt ja teine ​​kasutab võtmepunkti sisendi võtmepunkti funktsioone. Meie pakutav mitmevooline sisend koosneb RGB- ja võtmepunkti funktsioonidest. Võrdlustulemus ühe voo ja mitme voo kasutamisel on toodud tabelis 1. Siin näeme, et mitme voo funktsiooni kasutades saame parema tulemuse kui ühte voogu kasutades. Peavool saadakse täiskaadri RGB-funktsioonist ja lisavoog kasutab võtmepunkti funktsioone. Täiendav võtmepunktide voog aitab mudelil paremini õppida, eriti käe kuju üksikasju jäädvustada.

Tabel 1. WER-i jõudluse võrdlus ühe voo ja mitme voo sisendiga.

Table 1. WER Performance comparison using single stream and multi-stream input.


4.5. Katsetage tähelepanu moodulit

Selle katse eesmärk oli valida tähelepanu mooduli parim konfiguratsioon. Selles katses kasutame eelmise katse tulemuse parima tulemuse konfiguratsiooni ja sama andmestikku. Ruumilist tähelepanu tähistame mudelina, mille ruumimooduli lõpus on iga funktsiooni jaoks enesetähelepanu kiht. Varajane ajaline tähelepanu on enesetähelepanu kiht pärast esimest ajalist koondamist ja hiline ajaline tähelepanu on enesetähelepanu kiht pärast teist ajalist koondamist. Siin võrdleme kõiki ülaltoodud konfiguratsioone ning ruumilise ja ajalise tähelepanu kombinatsiooni. Tulemus on toodud tabelis 2. Ruumilise tähelepanu tulemus on halvem kui ajalises tähelepanus. Ruumiline tasand sisaldab iga kaadri funktsioonide jada. Nagu artiklis [20] mainitud, on enesetähelepanu kihil lihtsam õppida lühemat teed pikkade sõltuvuste vahel. Seetõttu ei suuda ruumiline tähelepanu pika järjestuse tõttu WER-i vähendada. Teisest küljest suutsime ajalist tähelepanu kasutades saada parema tulemuse, pannes selle pärast ühendamist, et see saaks lühema jada pikkuse. Kõige lühema jada pikkusega hiline tähelepanu saavutab parima tulemuse. Pealegi on tähelepanumooduli kombinatsioon ruumilises ja ajalises osas hullem kui ainult ühe tähelepanu kasutamine. Nende tulemuste põhjal rakendame katsete jaoks parimat konfiguratsiooni.

Tabel 2. WER-i jõudluse võrdlus erineva tähelepanu konfiguratsiooniga

Table 2. WER Performance comparison using different attention configuration


4.6. Ablatsioonikatse STAMF-võrgus

Lisaks teostame ablatsioonikatse, kasutades sama andmekogumit ning sisendvoo ja tähelepanumooduli parimat konfiguratsiooni. Tabel 3 katse kohta, milles kasutati hilist ajalist tähelepanu ilma koondamiseta, tõestab, et järjestuse pikkus mõjutab tähelepanuvõimet. Katsed, mis kasutavad lühema järjestuse pikkusega ühendavaid kihte, annavad paremaid tulemusi. Samuti viime läbi ablatsioonikatse, et jõudlust teada saada, kasutades järjestuse õppimiseks erinevaid mudeleid. Tabelis 4 toodud tulemus näitab, et LSTM-i kasutamine, millel on ainult ühesuunaline teave, on madalama jõudlusega kui kahesuunalise teabega Bi-LSTM-i kasutamine.

Tabel 3. WER-i tulemuslikkuse võrdlus, kasutades erinevaid hilise ajalise tähelepanu konfiguratsioone.

Table 3. WER Performance comparison using different late temporal attention configurations.

Tabel 4. WER-i jõudluse võrdlus, kasutades erinevat järjestuse õppimise konfiguratsiooni.

Table 4. WER Performance comparison using different sequence learning confifiguration.


4.7. Katsetage STAMF-i võrgus

Selles jaotises selgitame meie pakutud mudeli, mida nimetatakse ruumiajaliseks tähelepanelikuks mitmefunktsiooniks (STAMF), täielikku koolitusprotsessi. See hõlmab seda, kuidas sobitame oma sisendandmed samm-sammult ruumimoodulisse, ajalisse moodulisse ja järjestusõppe moodulisse. Selles jaotises kasutame mitme voo sisendit ja hilise ajalise tähelepanu konfiguratsiooni.

4.7.1. Rakenduse üksikasjad

Teostame täielikku koolitust ja testimist, kasutades sisendkaadreid suurusega 224 × 224. Optimeerija jaoks kasutame õppimiskiiruseks Adami optimeerijat, mille õppimiskiirus on 10–4 ja jagame selle 2-ga 10. ja 15. CSL-i ja 15. 30., 40. ja 60. ajastud RWTH PHOENIXi jaoks. Seadsime partii suuruseks 4 ja teostame RWTH-PHOENIXi jaoks 80 perioodi ja CSL-i jaoks 20 perioodi. Koolitus ja testimine viidi läbi NVIDIA Tesla V100 ja 128G RAM-iga.

Alguses ekstraheerisime funktsiooni ResNet50 abil RGB-voogudest ja kasutasime võtmepunkti hankimiseks HRNeti ja seejärel eraldasime võtmepunkti funktsioonid ResNet50 abil. Pange tähele, et tegemist oli järjestikuste andmete või videoga. Seetõttu pidime konfigureerima oma sisendi suuruse sõltuvalt video pikkusest. Tehnilistel põhjustel pidi kõigi andmete sisestussuurus olema üksteisega identne. Seetõttu peame teadma oma andmestiku pikima videot, seejärel suurendasime sisendkaadri pikkust, et see vastaks suurimale kaadri numbrile

Neid järjestikku ekstraheeritud funktsioone kasutas ajaline moodul. Iga järjestikune voog läbis kaks virnastatud ajalist koondamist. Iga ajaline kogumine koosnes 1-mõõtmelisest konvolutsioonivõrgust ja maksimaalsest kogumiskihist, mis vähendas järjestuse pikkust poole võrra. Mõlema voo ajalise ühendamise väljund ühendati seejärel tähelepanukihiga ja viimase ajalise koondamise jaoks ühendati see pärast tähelepanukihti lõpus ajalise mooduli väljundina.

Ajalist väljundit töötles järjestusõppe moodul. Protsessis kasutati CTC-ga ühendatud Bi-LSTM-i kihti, et saada lõplik joondus ja koostada läige viimaseks lauseks.

4.7.2. Kvantitatiivne tulemus

Viimaseid lauseid võrreldi põhitõega, et arvutada WER-i skoor kvantitatiivse tulemusena. CSL-i jaoks jagasime andmestiku treeningandmete jaoks 80 protsendiks ja testimisandmete jaoks 20 protsendiks. Nagu on näidatud tabelis 5, võib meie pakutud mitme funktsiooniga mudel (STMF), mis kasutab täiskaadri ja võtmepunkti funktsioone, saavutada parema tulemuse ja vähendada WER-i väärtuseni 0,8, võrreldes mudeliga, mis kasutab ainult täiskaadri funktsiooni [23]. Meie parima tulemuse saavutas pakutud mitme funktsiooniga mudel, kasutades tähelepanumehhanismi (STAMF), mis saavutas WER-i jaoks 0, 7. Tähelepanu kiht parandas tulemust siiski veidi, kuigi CSL-i andmestikul puudusid defektsed kaadrid. See tõestab, et tähelepanukihil on mudelile mõju. Kavandatud mitme funktsiooniga mudel ise on tipptasemel meetoditest parem ja tähelepanukiht aitab kaasa CSL-i andmestiku WER-i skoori vähendamisele. CSL-i võtmepunkt avaldab märkimisväärset mõju, kuna see võib anda tõhusat teavet võrreldes teise mitme funktsiooniga meetodiga [17], mis kasutab käte, näo ja keha poose.

Andmestiku RWTH-PHOENIX jaoks kasutasime treening- ja testimisandmete jagamiseks kunstlikku konfiguratsiooni. Andmekogum jagati 5672 näidisvideoks koolituseks, 540 näidisvideoks enesekontrolliks ja 629 proovivideoks testimiseks. Nagu on näidatud tabelis 6, oli meie pakutud mitme funktsiooniga mudeli (STMF) tulemus täiskaadri ja võtmepunkti funktsioonide kasutamisel 24 protsenti WER ja meie parim tulemus oli 20,5 protsenti , mis saadi pakutud mudeli abil, kasutades tähelepanu moodulit (STAMF). treeningtulemuses. Testitulemused on paremuselt teisel kohal võrreldes [17]-ga, kuna need kasutavad sisendina rohkem funktsioone. Siiski on tähelepanumoodul andnud olulise panuse RWTHPHOENIX-i andmestiku WER-skoori vähendamisesse. Erinevalt meie tulemustest CSL-i andmestiku kohta, ei saavutanud meie pakutud mitmevooga mudel optimaalset tulemust. Selle põhjuseks on asjaolu, et RWTH-PHOENIXi andmestikul on palju defektseid kaadreid; neil on udune osa, eriti käte piirkonnas. See raam annab puuduva või vale võtmepunkti asukoha tõttu ebajärjekindlat võtmepunkti teavet ja muudab mudeli vähem optimaalseks. Selle probleemi lahendamiseks lisatakse meie pakutud mitme funktsiooniga mudelile tähelepanukiht, mis aitab valida õiget teavet ja annab märkimisväärseid edusamme võrreldes pakutud mitme funktsiooniga mudeliga ilma tähelepanuta.

Tabel 5. WER-i toimivuse võrdlus CSL-i andmekogumis.

Table 5. WER Performance comparison on the CSL dataset.

Tabel 6. WER-i jõudluse võrdlus RWTH-PHOENIX-i andmekogumis.

Table 6. WER Performance comparison on the RWTH-PHOENIX dataset.


4.7.3. Kvalitatiivne tulemus

Samuti viisime oma mudelile läbi kvalitatiivse hindamise, kasutades tuvastamise tulemuse visualiseerimist. Joonisel 8 on näidatud meie kvalitatiivse hindamise üksikasjad, kasutades kolme lausenäidist. Esimene lause koosneb 10 sõnast ja kaadrite koguarv on 220. Teine lause koosneb 12 sõnast ja kaadrite koguarv on 168. Kolmas lause koosneb 9 sõnast ja kaadrite koguarv on 135.

Näidistulemus näitab, et mudelid ei ennusta mõnda läike õigesti ja tähistame seda punase märgiga. Siiski võib see siiski ennustada enamikku õigetest sõnadest. Kõige rohkem vigu on esimeses lauses, millel on pikim kaadrinumber. Selles lauses on lause alguses rohkem vigu, kuna mitmed algsõnade žestid on vaid veidi erinevad, mistõttu on piiride eristamine keeruline. Väljapakutud mitme funktsiooni ja tähelepanuga mudel (STAMF) suutis siiski tuvastada rohkem sõnu, kuid need olid valesti märgistatud. Lisaks saavutab tähelepanuga mudeli konfiguratsioon parema äratundmistulemuse veel kahe proovi jaoks, võrreldes pakutud mudeliga ilma tähelepanuta.

Figure 8.


Joonis 8. Tuvastamistulemuse kvalitatiivne hindamine RWTH-PHOENIX andmestiku erineva konfiguratsiooni abil [33,39]. Valed ennustatud läiked on märgitud punasega.

5. Kokkuvõtted

Selles artiklis tutvustame CSLR-i jaoks uudset ruumi-ajalist tähelepanelikku mitmefunktsiooni (STAMF), mille eesmärk on õppida ruumilis-ajalisi korrelatsioone ja olulist teavet visuaalsete funktsioonide ja võtmepunktide funktsioonide jadast täielikus lähenemisviisis. Meie raamistikus töötati välja ruumiline moodul täiskaadri funktsiooniga RGB andmetest ja põhipunktidest keha võtmepunktidest, sealhulgas mitme funktsioonina käed. Need kombinatsioonid, mida kasutati mitme voo funktsioonisisendina, andsid parema jõudluse võrreldes nüüdisaegse lähenemisviisiga, mis kasutab ainult täiskaadrit, või võrreldes meetodiga Joonis 8. Tuvastamistulemuse kvalitatiivne hindamine RWTH erineva konfiguratsiooni abil -PHOENIXi andmestik [33,39]. Valed ennustatud läiked on märgitud punasega. 5. Järeldused Selles artiklis tutvustame CSLR-i jaoks uudset ruumi-ajalist tähelepanelikku mitmefunktsiooni (STAMF), mille eesmärk on õppida ruumilis-ajalisi korrelatsioone ja olulist teavet visuaalsete tunnuste ja põhipunktide järjestusest lõpp-punktini. lõpu lähenemine. Meie raamistikus töötati välja ruumiline moodul täiskaadri funktsiooniga RGB andmetest ja põhipunktidest keha võtmepunktidest, sealhulgas mitme funktsioonina käed. Need kombinatsioonid, mida kasutati mitme voo funktsioonisisendina, andsid suurepärase jõudluse võrreldes tipptasemel lähenemisviisiga, mis kasutab ainult täiskaadrit, või võrreldes meetodiga, mis kasutab teist mitme funktsiooni kombinatsiooni, eriti CSL-i andmestiku puhul. Seejärel pakume välja ajamooduli, mis koosneb ajalisest koondamisest ja ajalisest tähelepanust, et koguda ajalises domeenis olulist teavet. Hilise ajalise tähelepanu lisamine on võimeline saama valet teavet sisaldavast järjestusest olulise tunnuse ja annab meie pakutud mitmefunktsioonilise mudeliga võrreldes märkimisväärset edu. Samuti aitab see järjestusõppel paremini õppida ja suurendab jõudlust nagu CSL-i andmestiku katses. Laiaulatuslikud katsed sagedamini kasutatavate andmekogumitega näitavad meie pakutud mudeli paremust tipptasemel mudelist, kusjuures WER-i skoor väheneb CSL-i andmekogumi puhul enam kui 50 protsenti ja RWTH-PHOENIX-i andmekogumi puhul 5 protsenti. Tulevikus plaanime rakendada ülekande õppimise tehnikat nii oma praeguse mudeliga kui ka rakendada oma käimasolevat tööd reaalses tööstuses.

Viited

1. Dreuw, P.; Rybach, D.; Deselaers, T.; Zahedi, M.; Ney, H. Kõnetuvastustehnikad viipekeele tuvastamise süsteemi jaoks. In Proceedings of the INTERSPEECH 2007, International Speech Communication Associationi 8. aastakonverents, Antwerpen, Belgia, 27.–31. august 2007; lk 2513–2516.

2. Ong, SCW; Ranganath, S. Automaatne viipekeele analüüs: uuring ja tulevik leksikaalsest tähendusest kaugemale. IEEE Trans. Muster Anal. Mach. Intell. 2005, 27, 873–891. [CrossRef] [PubMed]

3. Vogler, C.; Metaxas, D. Ameerika viipekeele samaaegsete aspektide tunnustamise raamistik. Arvuta. Vis. Image Underst. 2001, 81, 358–384. [CrossRef]

4. Bowden, R.; Windridge, D.; Kadir, T.; Zisserman, A.; Brady, M. Keelelise tunnuse vektor viipekeele visuaalseks tõlgendamiseks. Euroopa arvutinägemise konverentsi (ECCV) kogumikus, Praha, Tšehhi Vabariik, 11.–14. mai 2004; lk 390–401.

5. Kasukurthi, N.; Rokad, B.; Bidani, S.; Dennisan, DA Ameerika viipekeele tähestiku tuvastamine süvaõppe abil. arXiv 2019, arXiv:1905.05487.

6. Koller, O.; Zargaran, S.; Ney, H.; Bowden, R. Deep Sign: Tugeva statistilise pideva viipekeele tuvastamise võimaldamine hübriid-CNN-HMM-ide kaudu. Int. J. Comput. Vis. 2018, 126, 1311–1325. [CrossRef]

7. Pu, J.; Zhou, W.; Li, H. Laiendatud konvolutsioonivõrk koos iteratiivse optimeerimisega pidevaks viipekeele tuvastamiseks. In Proceedings of the Twenty-7th International Joint Conference on Artificial Intelligence, Stockholm, Rootsi, 13.–19.07.2018; lk 885–891.

8. Pu, J.; Zhou, W.; Li, H. Iterative Alignment Network for Continuous Viipekeele äratundmine. 15.–20. juunil 2019, Long Beach, CA, USA, IEEE Computer Society konverentsi arvutinägemise ja mustrite tuvastamise teemal Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition; lk 4160–4169.

9. Kumar, N. Liikumistrajektooril põhinev inimnäo ja käte jälgimine viipekeele äratundmiseks. In Proceedings of the 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Mathura, India, 26.–28.10.2017; lk 211–216.

10. Bhuyan, MK; Ghoah, D.; Bora, PK Viipekeele rakendustega käeliigutuste tuvastamise raamistik. 2006. aasta India aastakonverentsi kogumikus, INDICON, New Delhi, India, 15.–17. september 2006; lk 1–6.

11. Das, SP; Talukdar, AK; Sarma, KK Viipekeele äratundmine näoilme abil. Proceedings of the Procedia Computer Science, Kerala, India, 10.–13. august 2015; lk 210–216.

12. Rastgoo, R.; Kiani, K.; Escalera, S.; Sabokrou, M. Viipekeele produktsioon: ülevaade. 2021. aasta IEEE/CVF konverentsi arvutinägemise ja mustrite tuvastamise töötubade (CVPRW) toimetuses, Nashville, TN, USA, 19.–25. juuni 2021; lk 3446–3456.

13. Dong, S.; Wang, P.; Abbas, K. Süvaõppe ja selle rakenduste uuring. Arvuta. Sci. Rev. 2021, 40, 100379. [CrossRef]

14. Athitsos, V.; Neidle, C.; Claroff, S.; Nash, J.; Stefan, A.; Yuan, Q.; Thangali, A. Ameerika viipekeele leksikoni videoandmekogum. 2008. aasta IEEE Computer Society konverentsi arvutinägemise ja mustrite tuvastamise töötubade toimetistes, CVPR Workshops, Anchorage, Alaska, 23.–28. juuni 2008; lk 1–8.

15. Bungeroth, J.; Stein, D.; Dreuw, P.; Ney, H.; Morrissey, S.; Way, A.; Zijl, LV ATISe viipekeele korpus. In Proceedings of the 6th International Conference on Language Resources and Evaluation, LREC 2008, Marrakech, Maroko, 28.–30. mai 2008; lk 2943–2946.

16. Papastratis, I.; Chatzikonstantinou, C.; Konstantinidis, D.; Dimitropoulos, K.; Daras, P. Tehisintellekti tehnoloogiad viipekeele jaoks. Andurid 2021, 21, 5843. [CrossRef] [PubMed]

17. Zhou, H.; Zhou, W.; Zhou, Y.; Li, H. Ruumilis-ajaline multi-cue võrk pidevaks viipekeele tuvastamiseks. In Proceedings of the AAAI 2020 – The Thirty-Fourth AAAI Conference on Artificial Intelligence, New York, NY, USA, 7.–12. veebruar 2020; lk 13009–13016.

18. Gündüz, C.; Polat, H. Türgi viipekeeletuvastus, mis põhineb mitmevoolulisel andmesulamisel. Türgi J. Electr. Eng. Arvuta. Sci. 2021, 29, 1171–1186. [CrossRef]

19. Bohacek, M.; Hruz, M. Viipepoosil põhinev transformer sõnatasemel viipekeele tuvastamiseks. 2022. aasta IEEE/CVF Winter Conference on Applications of Computer Vision Workshops toimetuses, WACVW, Waikoloa, HI, USA, 4.–8. jaanuar 2022; lk 182–191.

20. Vaswani, A. Tähelepanu on kõik, mida vajate. In Proceedings of the Conference on Neural Information Processing Systems, Long Beach, CA, USA, 4.–9.12.2017; lk 1–11.

21. Zhou, M.; Ng, M.; Cai, Z.; Cheung, KC Enesetähelepanu põhinevad täielikult alustatud võrgustikud pidevaks viipekeele äratundmiseks. Esiosa. Artif. Intell. Rakendus 2020, 325, 2832–2839.

22. Camgöz, NC; Koller, O.; Hadfifield, S.; Bowden, R. Viipekeele muundurid: ühine viipekeele tuvastamine ja tõlkimine. 14.–19. juunil 2020, Seattle, WA, USA, IEEE Computer Society konverentsi arvutinägemise ja mustrite tuvastamise teemal Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition; lk 10020–10030.

23. Min, Y; Hao, A.; Chai, X.; Chen, X. Visual Alignment Constraint for Continuous Viipekeele äratundmine. In Proceedings of the IEEE International Conference on Computer Vision (ICCV), Montreal, BC, Kanada, 10.–17. oktoober 2021; lk 11542–11551.

24. Guo, D.; Zhou, W.; Wang, M.; Li, H. Viipekeele tuvastamine, mis põhineb adaptiivsetel HMM-idel andmete suurendamisega. In Proceedings of the IEEE International Conference on Image Processing (ICIP), Phoenix, AZ, USA, 25.–28. september 2016; lk 2876–2880.

25. Huang, J.; Zhou, W.; Li, H.; Li, W. Viipekeele tuvastamine 3D-konvolutsiooniliste närvivõrkude abil. In Proceedings of the IEEE International Conference on Multimedia and Expo (ICME), Torino, Itaalia, 29. juuni–3. juuli 2015; lk 1–6.

26. Guo, D.; Zhou, W.; Li, H.; Wang, M. Online varajase ja hilise fusioon, mis põhineb adaptiivsel HMM-il viipekeele tuvastamiseks. ACM Trans. Multimed. Arvuta. Commun. Rakendus 2017, 14, 1–18. [CrossRef]

27. Al-hammadi, M.; Muhammad, G.; Liige, S. Viipekeele käeliigutuste tuvastamine 3DCNN-i abil. IEEE Access 2020, 8, 79491–79509. [CrossRef]

28. Reza, H.; Joze, V. MS-ASL: Suuremahuline andmekogum ja võrdlusalus Ameerika viipekeele mõistmiseks. arXiv 2019, arXiv:1812.01053.

29. Li, D.; Opazo, CR; Yu, X.; Li, H. Sõnataseme sügav viipekeele tuvastamine videost: uus suuremahuline andmekogum ja meetodite võrdlus. 2020. aasta IEEE Winter Conference on Applications of Computer Vision toimetistes, WACV, Snowmass Village, CO, USA, 1.–5. märts 2020; lk 1448–1458.

30. Pu, J.; Zhou, W.; Li, H. Viipekeele tuvastamine multimodaalsete funktsioonidega. Vaikse ookeani äärealade multimeediakonverentsi toimetistes, Xi'an, Hiina, 15.–16. september 2016; lk 252–261.

31. Jiang, S.; Sun, B.; Wang, L.; Bai, Y.; Li, K.; Fu, Y. Skeleton Aware Multimodaalne viipekeele äratundmine. IEEE Computer Society konverentsi arvutinägemise ja mustrite tuvastamise töötubade kogumikus Nashville, TN, USA, 19.–25. juuni 2021; lk 3408–3418.

32. Sidig, AAI; Luqman, H.; Mahmoud, S.; Mohandes, M. KArSL: Araabia viipekeele andmebaas. ACM Trans. Aasia madala ressursiga. Lang. Info Töötlemine 2021, 20, 1–19. [CrossRef]

33. Koller, O.; Forster, J.; Ney, H. Pidev viipekeeletuvastus: Suure sõnavaraga statistiliste tuvastamissüsteemide poole, mis käsitlevad mitut allkirjastajat. Arvuta. Vis. Image Underst. 2015, 141, 108–125. [CrossRef]

35. Koller, O.; Camgoz, NC; Ney, H. Nõrgalt juhendatud õpe mitme vooga CNN-LSTM-HMM-idega, et avastada järjestikust paralleelsust viipekeelevideotes. IEEE Trans. Muster Anal. Mach. Intell. 2020, 42, 2306–2320. [CrossRef] [PubMed]

35. Camgoz, NC; Hadfifield, S.; Koller, O.; Bowden, R. SubUNets: End-to-End Hand Shape and Continuous Viipekeele tuvastamine. In Proceedings of the 2017 IEEE International Conference on Computer Vision (ICCV), Veneetsia, Itaalia, 22.–29. oktoober 2017; lk 3075–3084.

36. Dong, C.; Loy, CC; Tema, K.; Tang, X. Kujutise ülilahutusvõime, kasutades sügavaid konvolutsioonivõrke. IEEE Trans. Muster Anal. Mach. Intell. 2014, 38, 295–307. [CrossRef] [PubMed]

37. Bressem, KK; Adams, LC; Erxleben, C.; Hamm, B.; Niehues, SM; Vahldiek, JL Erinevate süvaõppe arhitektuuride võrdlemine rindkere röntgenülesvõtete klassifitseerimiseks. Sci. Vabariik 2020, 10, 13590. [CrossRef]

38. Sun, K.; Xiao, B.; Liu, D.; Wang, J. Kõrge eraldusvõimega esitusõpe inimese poosi hindamiseks. 15.–20. juunil 2019, Long Beach, CA, USA, IEEE Computer Society konverentsi arvutinägemise ja mustrite tuvastamise teemal Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition; lk 5686–5696.

39. Koller, O.; Zargaran, S.; Ney, H. Re-Sign: Re-Aligned End-to-End Sequence Modeling with Deep Recurrent CNN-HMMs. 2017. aasta IEEE arvutinägemise ja mustrite tuvastamise (CVPR) konverentsil, Honululu, HI, USA, 21.–26. juuli 2017; lk 3416–3424.

40. Zhou, H.; Zhou, W.; Li, H. Dünaamiline pseudosildi dekodeerimine pidevaks viipekeele tuvastamiseks. 2019. aasta IEEE rahvusvahelise multimeediumi- ja näitusekonverentsi (ICME) toimetised, Shanghai, Hiina, 18.–21. juuli 2019; lk 1282–1287.

41. Xiao, Q.; Chang, X.; Zhang, X.; Liu, X. Videopõhine viipekeele tuvastamine ilma ajalise segmentimiseta. In Proceedings of the Thirty-Second AAAI Conference on Artificial Intelligence, New Orleans, LA, USA, 2.–7. veebruar 2018; lk 2257–2264.

42. Graves, A.; Fernández, S.; Gomez, F.; Schmidhuber, J. Connectionist Temporal Classification: Labeling Unsegmented Sequence Data with Recurrent Neural Networks. Proceedings of the ICML '06: 23. rahvusvahelise masinõppe konverentsi materjalid, Pittsburgh, PA, USA, 25.–29. juuni 2006; lk 369–376.

43. Graves, A.; Liwicki, M.; Fernández, S.; Bertolami, R.; Bunke, H.; Schmidhuber, J. Uudne konneksionistlik süsteem piiramatuks käekirja tuvastamiseks. IEEE Trans. Muster Anal. Mach. Intell. 2009, 31, 855–868. [CrossRef]

44. Guo, D.; Zhou, W.; Li, H.; Wang, M. Hierarhiline LSTM viipekeele tõlke jaoks. In Proceedings of the AAAI Conference on Artificial Intelligence, New Orleans, LA, USA, 2.–7. veebruar 2018; lk 6845–6852.

45. Rahman, MM; Watanobe, Y.; Nakamura, K. Kahesuunaline LSTM-i keelemudel koodide hindamiseks ja parandamiseks. Sümmeetria 2021, 13, 247. [CrossRef]

46. ​​Hu, W.; Cai, M.; Chen, K.; Ding, H.; Sun, L.; Liang, S.; Mo, X.; Huo, Q. Sequence Diskriminatiivne koolitus võrguühenduseta käsitsikirja tuvastamiseks interpoleeritud CTC ja võrevaba MMI eesmärkfunktsiooni abil. In Proceedings of the International Conference on Document Analysis and Recognition, ICDAR, Kyoto, Jaapan, 9.–15.11.2017; 1. köide, lk 61–66.

47. Yoshimura, T.; Hayashi, T.; Takeda, K.; Watanabe, S. Täielik automaatne kõnetuvastus, mis on integreeritud CTC-põhise häältegevuse tuvastamisega. In Proceedings of the ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing, Barcelona, ​​Hispaania, 4.–8. mai 2020; lk 6999–7003.

48. Guo, D.; Wang, S.; Tian, ​​Q.; Wang, M. Tihe ajaline konvolutsioonivõrk viipekeele tõlkimiseks. Kahekümne kaheksanda tehisintellekti rahvusvahelise ühiskonverentsi (IJCAI-19) toimingutes, Aomen, Hiina, 10.–16. august 2017; lk 744–750.

49. Wang, S.; Guo, D.; Zhou, W.; Zha, Z.; Wang, M. Connectionist Temporal Fusion for Viipekeele tõlkimine. In Proceedings of the 26th ACM International Conference on Multimedia, Soul, Korea, 22.–26.10.2018; lk 1483–1491.

50. Yang, Z.; Shi, Z. SF-Net: Struktureeritud funktsioonide võrgustik pidevaks viipekeele tuvastamiseks. arXiv 2019, arXiv:1908.01341.

51. Cheng, KL; Yang, Z.; Chen, Q.; Tai, Y. Täielikult konvolutsioonilised võrgud pidevaks viipekeele äratundmiseks. Euroopa arvutinägemise konverentsi toimetistes, Glasgow, Ühendkuningriik, 23.–28. august 2020; lk 697–714.

53. Koller, O.; Ney, H.; Bowden, R. Deep Hand: Kuidas koolitada CNN-i 1 miljonil käsitsi pildil, kui teie andmed on pidevad ja nõrgalt märgistatud. In Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, 27.–30. juuni 2016; lk 3793–3802.

53. Slimane, FB Kontekst on oluline: enesetähelepanu viipekeele äratundmiseks. arXiv 2021, arXiv:2101.04632.

55. Niu, Z.; Mak, B. Mitmeolekuliste märgiläikete stohhastiline peeneteraline märgistamine pidevaks viipekeele tuvastamiseks. Euroopa arvutinägemise konverentsi toimetistes, Glasgow, Ühendkuningriik, 23.–28. august 2020; lk 1–16.

55. Cui, R.; Liu, H.; Zhang, C. A Deep Neural Framework for Continuous Viipekeele äratundmiseks iteratiivse koolituse abil. IEEE Trans. Multimed. 2019, 21, 1880–1891. [CrossRef]

56. Pu, J.; Zhou, W.; Ah.; Li, H. Pideva viipekeele äratundmise suurendamine ristmodaalsuse suurendamise kaudu. 28. ACM rahvusvahelise multimeediakonverentsi toimetistes, Seattle, WA, USA, 12.–16. oktoober 2020; lk 1497–1505.

Ju gjithashtu mund të pëlqeni