Emotsionaalsete seisundite seletatav automatiseeritud äratundmine koerte näoilmetest: positiivse ootuse ja frustratsiooni juhtum
Aug 11, 2023
Adami optimeerija kasutamine õppimiskiirusega {{0}}.0001. Parimaks mudeliks valiti mudel, mis saavutas valideerimisandmestiku maksimaalse täpsuse. Esimese 10 epohhi jooksul viidi kõigi kihtide raskused täpselt paika. Esimese 10 epohhi jooksul oli kõigi kihtide kaal peenhäälestatud. Ülejäänud epohhide ajal külmutati ResNet50 kaalud ja värskendati ainult uute pealiskihtide kaalu. Orientatsiooniga mitteseotud muutujate jaoks ('kõrvade lamendaja', 'huulte osa', 'kõrvade liiteseade', 'kõrvad ettepoole' ja 'nina lakkumine') rakendasime suurendamistehnikat, mis põhines juhuslikul kujutise horisontaalsel kallutamisel ja pööramisel kuni 20 kraadi. Kodeerija sisendina kasutasime sisendtabelit, kus iga rida tähistab iga video 11 DogFACS-i muutuja olemasolu (1) / puudumist (0). Kodeerija sihtmärk on tabel, mis sisaldab iga video tingimust (negatiivne(0)/positiivne(1)).
ResNet50 on sügav närvivõrgu arhitektuur, millest on saanud üks klassikalisi võrke arvutinägemise valdkonnas. ResNet50 võrku iseloomustab väga tugev mälu ja oskus meeles pidada koolitusel varem õpitud teadmisi, mis teeb selle keerukates pildituvastusülesannetes hästi toime.
Kuidas ResNet50 mälu saavutab? See võtab kasutusele jääkühenduse meetodi ja lisab igas konvolutsioonikihis kihtide vahel otseteeühenduse, mis võib muuta teabe liikumise võrgus paremaks. Tänu nende otseteeühenduste olemasolule saab võrk koolitusprotsessi käigus ülejäänud vastendusi lihtsamini õppida ega pea kulutama liiga palju aega nende allesjäänud vastenduste otsimisele.
Selline mälu jõudlus paneb ResNet50 hästi hakkama suuremahuliste pildituvastusülesannetega. Selliste probleemide puhul nagu piltide klassifitseerimine, sihtmärgi tuvastamine ja näotuvastus on ResNet50 saavutanud väga häid tulemusi. See mälu jõudlus sarnaneb meie ajuga, mis ühendab mälu parandamiseks ka neuroneid. Seega võib öelda, et ResNet50 on väga hea süvanärvivõrgu mudel, millel on tugev mälu ja mis saab hästi hakkama keerukate pildituvastusülesannetega. Samas annab see meile ka inspiratsiooni. Saame õppida ResNet50 ideedest, et kujundada tõhusam sügava närvivõrgu mudel, mis rahuldaks paremini inimeste vajadusi. On näha, et me peame oma mälu parandama. Cistanche võib parandada mälu, sest Cistanche on traditsiooniline Hiina ravimmaterjal, millel on palju ainulaadseid toimeid, millest üks on mälu parandamine. Hakkliha tõhusus tuleneb erinevatest selles sisalduvatest toimeainetest, sealhulgas karboksüülhappest, polüsahhariididest, flavonoididest jne. Need koostisosad võivad erinevate kanalite kaudu edendada aju tervist.

Klõpsake ajufunktsiooni parandamise viisidel
Loomauuringutes on afektiivse seisundi äratundmise automatiseerimine seni peamiselt käsitlenud mõne liigi valu. Emotsionaalsed seisundid jäävad nende näomorfoloogia ja ilmete keerukuse tõttu kaardistamata aladeks, eriti koertel. See uuring aitab lünka täita kahes aspektis. Esiteks on see esimene, mis käsitleb koerte emotsionaalseid seisundeid, kasutades kontrollitud eksperimentaalses keskkonnas saadud andmekogumit, sealhulgas videoid (n=29) labradori retriiveritelt, mille puhul eeldatakse, et neil on kaks eksperimentaalselt esilekutsutud emotsionaalset seisundit: negatiivne (frustratsioon) ja positiivne. (ootus). Koerte näoilmeid mõõdeti Dogs Facial Action Coding System (DogFACS) abil.
Võrreldakse kahte erinevat lähenemist abaatori eesmärgiga: (1) DogFACS-põhine lähenemine kaheastmelise torujuhtmega, mis koosneb (i) DogFACS-i muutujadetektorist ja (ii) positiivse/negatiivse oleku otsusepuu klassifikaatorist; (2) Süvaõppe tehnikaid kasutav lähenemine ilma vahepealse esituseta. Lähenemisviiside täpsus on vastavalt üle 71% ja 89%, kusjuures süvaõppe lähenemisviis toimib paremini. Teiseks on see uuring ka esimene, mis uurib AI mudelite seletatavust loomade emotsioonide kontekstis. DogFACS-il põhinev lähenemisviis pakub otsustuspuud, mis on matemaatiline esitus, mis peegeldab inimekspertide varasemaid leide teatud näoilmete (DogFACS-i muutujad) kohta, mis on korrelatsioonid konkreetsete emotsionaalsete seisunditega. Süvaõppe lähenemisviis pakub erinevat visuaalset seletatavuse vormi soojuskaartide kujul, mis kajastavad võrgu tähelepanu fookuspiirkondi, mis mõnel juhul näitavad fookust, mis on seotud konkreetsete DogFACS-i muutujate olemusega. Need soojuskaardid võivad olla võtmeks uudsetele arusaamadele võrgu tundlikkusest nüansirikaste pikslimustrite suhtes, mis peegeldavad inimsilmale nähtamatut teavet.
Charles Darwin kirjeldas oma põhjapanevas teoses „Inimese ja loomade emotsioonide väljendus”1 kuulsalt näoilmete kasutamist kui emotsionaalse seisundi kuvamist inimestel ja erinevatel liikidel, kes ei ole inimesed (edaspidi loomad). Tänapäeval on laialdaselt tunnustatud, et näoilmed on emotsionaalsete seisundite äratundmisel oluline teabeallikas. Inimestel on näoilmed esmase mitteverbaalse vahendina, mis reguleerib koostoimeid2 ning näoilmete ja emotsionaalsete seisundite seos on juba ammu kindlaks tehtud süstemaatiliste psühholoogiauuringutega3,4. Loomadel toodavad näoilmeid enamik imetajaliike5 ja nagu inimestelgi, eeldatakse, et need edastavad teavet emotsionaalsete seisundite kohta6,7. Seetõttu uuritakse loomade emotsioonide ja heaolu uuringutes üha enam näoilmeid kui potentsiaalseid subjektiivsete seisundite indikaatoreid.
Kuldstandard näoilmete muutuste objektiivseks hindamiseks inimemotsioonide uurimisel on Facial Action Coding System – FACS8,9. FACS-i on hiljuti kohandatud erinevatele mitteinimeseliikidele, sealhulgas mitmetele ahvilistele (nt orangutangid10, šimpansid11, makaagid12,13), marmosettidele14, koertele15 ja kassidele16. Neid süsteeme, millele viidatakse kui AnimalFACS, kasutatakse nagu inimestelgi üha enam loomade emotsionaalsete seisundite uurimiseks (nt 17–19).
Suur väljakutse standardiseeritud näoilmete tuvastamisel koertel puudutab nende peade morfoloogilist mitmekesisust20, 21 ja neid katvaid nahastruktuure, näiteks püsivate kortsude lisamist mõnel tõul. Koerte näo-emotsionaalsete ilmete tuvastamiseks kasutasid Caeiro jt18 DogFACS-i, et hinnata erinevat tõugu ja segusid isendite spontaanseid reaktsioone naturalistlikes emotsionaalsetes tingimustes, kasutades veebivideoid. Uuriti nii positiivse kui ka negatiivse valentsiga emotsioone, sealhulgas tasu ootust (positiivselt valentsitud emotsioon) ja frustratsiooni (negatiivse valentsiga emotsioon), mida mõlemat iseloomustas soovitud stiimuli ootus16. Positiivne ootus defineeriti kui see, mis on esile kutsutud olukordades, mis hõlmavad "[v]toidu visualiseerimist või söögi/toiduga seotud sõna(de) kuulmist; [v]rihma visualiseerimist, kõndimisega seotud sõna(de) kuulmist" ja frustratsiooni määratleti kui on ajendatud "[v]soovitava ressursi (mänguasi, toit, ruum) visualiseerimine, mis on või muutub kättesaamatuks"18. Kuigi Caeiro et al.18 leidsid, et koertel esinesid teatud emotsionaalsete seisundite eristamisel oluliselt erinevad näoilmed, ei tuvastatud frustratsiooni kontekstis mingeid eristavaid tunnuseid. Vastavalt sellele uurisid Bremhorst jt 22 koerte positiivse ootuse ja frustratsiooni näoilmeid kontrollitud katsekeskkonnas, erinevalt Caeiro jt18 omast, standardiseerides ka koeratõu (labradori retriiver). Veelgi enam, autorid kasutasid mittesotsiaalset konteksti, et kõrvaldada varem õpitud tähelepanu tõmbamise vastustest tulenevate häirete oht. Mõlema uuritud emotsionaalse seisundi eksperimentaalseks esilekutsumiseks kasutati kõrge väärtusega toidupreemiat käivitava stiimulina kahel tingimusel: ennustati, et positiivne seisund kutsub esile positiivse ootuse (tingitud toiduootuse kaudu) ja negatiivne seisund peaks tekitama frustratsiooni (st. eeldatavale toidutasule juurdepääsu takistamine). Nendes kahes olekus koerte näoilmeid mõõdeti DogFACS-i abil. Autorid leidsid, et muutuja "Kõrvade lisaja" oli tavalisem positiivses seisundis, samas kui muutujad "Pilkumine", "Huulte osa", "Lõualangus", "Nina lakkumine" ja "Kõrvade lamendaja" olid tavalisemad negatiivses seisundis. seisund 22. Järeluuringus testisid Bremhorst et al.19 uut koerte rühma, kasutades sarnast seadistust. Selles uuringus kasutati siiski kahte erinevat tüüpi preemiaid (toit ja mänguasjad), et testida nende varasemate leidude üldistavust laiema konteksti jaoks19.
Varasemaid tulemusi korrati19, kusjuures negatiivses seisundis esines sagedamini neli muutujat: "Kõrvad allapoole", "Huulenurga tõmbaja", "Keeleshow" ja "Ülemise huuletõstja". Kõik tuvastatud näoilmed, välja arvatud "Upper Lip Raiser", ei sõltunud tasu tüübist, mida koerad ootasid19. Lisaks hinnati tuvastatud näoilmete kui potentsiaalsete emotsiooninäitajate diagnostilise täpsuse põhinäitajaid, sealhulgas nende tundlikkust, spetsiifilisust ning positiivseid ja negatiivseid ennustavaid väärtusi19. Tulemused näitasid, et ükski neist näoilmetest ei oleks andnud seotud emotsioonide järjekindlat õiget klassifikatsiooni, kui neid oleks kasutatud eraldi individuaalse emotsiooni indikaatorina19. See ei vähenda nende potentsiaalset väärtust signaalidena, vaid võib-olla rõhutab näokonfiguratsioonide tavalist terviklikku töötlemist23, mitte keskendumist selle üksikutele elementidele.
Publiku kohalolek emotsionaalses kontekstis on oluline element, mida tuleb arvesse võtta koerte näoilmete (emotsioonide) uurimisel, nagu näitas Pedretti jt hiljutine uuring24. Sarnaselt 19, 22-ga avaldasid autorid ka koeri positiivse ootuse ning mittesotsiaalse ja mittesotsiaalse frustratsiooniga, kutsudes esile testiseansse. Samuti kasutasid nad DogFACS-i, et analüüsida koerte näoilmeid sellistes olukordades, lisaks muule käitumisele, nagu saba liputamine ning sülje kortisooli kontsentratsiooni mõõtmine enne ja pärast testi. Nad leidsid, et "Ears Forward" esines rohkem positiivses seisundis kui negatiivsetes tingimustes. Lisaks mõjutas seda muutujat positiivselt publiku kohalolek ja see korreleerus negatiivselt testieelse kortisooli kontsentratsiooniga, mis viitab sellele, et see võib olla hea näitaja koerte tähelepanutaseme kohta. "Kõrvad lamedad", "pilgutamine", "nina lakkumine", "saba liputamine" ja "virisemine" (kaks viimast ei sisaldu DogFACS-i muutujates) olid samuti seotud publiku kohalolekuga, kuid ei olnud korrelatsioonis kortisooli kontsentratsiooniga, mis viitab. nende käitumiste kommunikatiivne komponent.

See näitab, et DogFACS võib kasutada ka koerte näoilmete uurimist mitte ainult vihjetena (st emotsionaalsete seisunditega kaasnevate käitumismuutuste tekitamisel), vaid ka signaalidena (st käitumine, mis on spetsiaalselt loodud suhtluspartnerile emotsioonide edastamiseks), vt ka 25. AnimalFACS-süsteemid on seega oluline vahend loomade näoilmete mõistmise edendamiseks. Nende süsteemide kasutamisel näoilme analüüsiks on aga oma väljakutsed, sealhulgas sõltuvus käsitsi märkimisest, mis nõuab ulatuslikku inimeste väljaõpet ja sertifitseerimist. See võib olla aeganõudev ja võib olla inimlik viga või eelarvamus26.
Automatiseerimine võib anda sellele protsessile olulise täiendava edasimineku. Eelkõige väidetakse, et automatiseeritud tööriistadel on suurem objektiivsus ja usaldusväärsus kui käsitsi kodeerimisel, välistades subjektiivsuse ja eelarvamusi27, 28, kuid nende edu ei sõltu ka üksiku funktsiooni tuvastamisest. Seetõttu pole üllatav, et näoilmete automaatne kodeerimine on inimeste emotsioonide uurimise elav valdkond, kus on saadaval arvukalt kaubanduslikke tarkvaratööriistu, nagu FaceReader by Noldus29, Afdex30, EmoVu31, aga ka ulatuslikke andmebaase, nagu CAS(ME)332.
Loomade puhul on näoilmete analüüsi automatiseerimine seevastu vähe uuritud. Selle põhjuseks on mitmed väljakutsed (nagu on arutanud 33, 34), sealhulgas esiteks kasvu suhteline hiljutisus või huvi loomade emotsioonide uurimise vastu, mis tähendab, et võrreldes inimvaldkonna tohutute andmehulkadega on saadaval palju vähem andmeid. Teiseks, eriti kodustatud liikide puhul, kujutab näo morfoloogia suur varieeruvus tehnilisi väljakutseid35. Lõpuks muudab verbaalse eneseteatamise puudumine loomadel kogetud emotsionaalse seisundi kohta tõe kindlakstegemise keeruliseks, samas kui inimestel on enesest teatamine selleks otstarbeks tavaline lähenemisviis. Loomade andmekogumisprotokollid nõuavad seega ulatuslikku kontrolli ja reguleerimist, uuritud emotsionaalsete seisundite operatiivseid määratlusi (vt nt 18) või võib-olla ka inimekspertide hinnanguid – kuigi see võib kaasa tuua eelarvamusi ja subjektiivseid hinnanguid.
Broomé et al.36 esitasid põhjaliku küsitluse kahekümnest uuringust, mis tutvustasid kaasaegseid lähenemisviise emotsioonide ja valu automatiseeritud äratundmiseks loomadel. Enamik neist töödest keskendub valu esinemisele. Selles kontekstis käsitletud liikide hulka kuuluvad närilised37–39, lambad40, hobused33,41,42 ja kassid43. Kõik need tööd pakuvad masinõppetehnikaid kasutades binaarset klassifikaatorit valu/valu puudumise kohta.
Loomade emotsioonide tuvastamise laialdasema automatiseerimisega tegelemine on palju napim. Kaks ahvilistega tehtud uuringut keskenduvad seotud tegevusüksuse/näoilme tuvastamisele, ilma emotsionaalseid seisundeid selgesõnaliselt käsitlemata44,45. Blumrosen jt44 automatiseerisid ahviliste nelja näoilme tuvastamise: neutraalne, huulte laksutamine, närimine ja suu juhuslik avamine minimaalse märkuste tegemisega, samas kui Morozov jt 45 rakendasid reesusmakaakide automaatse MaqFACS-i kodeerimise prototüüpsüsteemi. , mis on koolitatud kuue MacFACSi muutuja klassifitseerimiseks.
Broomé et al.36 uuriti ainult kolme tööd, mis pakuvad erinevate emotsionaalsete seisundite täielikku klassifikatsiooni. Corujo jt 46 defineerisid hobuste jaoks neli emotsionaalset seisundit: "ärevil", "ärritatud", "uudishimulik" ja "lõdvestunud", määratledes igaüks neist silmade, kõrvade, nina ja kaela käitumise järgi. Näiteks defineeriti "lõdvestunud" silmadena: osaliselt kuni enamasti kinni, kõrvad: lõdvestunud, külgedele suunatud ava, nina: lõdvestunud suu ja kael: ligikaudu paralleelsed. Nende nelja emotsiooniklassi ennustamiseks treeniti konvolutsioonilise närvivõrgu (CNN) mudelit. Ferres jt 47 kasutasid automatiseeritud poosi hindamist, kasutades DeepLabCut48, et klassifitseerida koerte jaoks neli emotsiooniklassi "viha", "hirm", "õnn" ja "lõõgastus". Franzoni jt 49 kasutasid CNN-i mudelit ka emotsionaalsete seisunditega seotud piiratud atribuutide klassifitseerimiseks: "naeratus" (seotud "rõõmuga"), "urisemine" (seotud "vihaga") ja "uni" (seotud neutraalse seisundiga). osariik).
Kolmest koertega seotud teosest47,49,50 keskendusid kaks keha emotsionaalsete seisundite47 ja valu50 äratundmisele ning üks emotsioonide näoilmele49. Ferresi jt 47 ja Franzoni jt 49 uuringutes kasutatud andmestikud sisaldasid aga Internetist kogutud ja mitteekspertide poolt annoteeritud pilte ning seetõttu olid need potentsiaalselt madala usaldusväärsuse ja kehtivusega. Zhu50 töö uurib valu tuvastamist kehakeele, mitte näoilmete põhjal.
Siin esitatud uuring on esimene, mis uurib koera emotsioonide automaatset äratundmist näoilmetest, kasutades hoolikalt kavandatud katseprotokollist kogutud andmekogumit, kus kontekst kaitseb emotsionaalseid seisundeid22. Selles protokollis määratleti positiivse ootuse (positiivne emotsioon) ja frustratsiooni (negatiivne emotsioon) emotsionaalsed seisundid (vastavalt 18-le ja kutsuti eksperimentaalselt esile 29 labradori retriiverist koosnevas proovis, minimeerides koerte morfoloogiliste erinevuste varieeruvust. toodetud koerte näoilmed kodeeriti objektiivselt standardiseeritud DogFACS-süsteemi kasutades sertifitseeritud DogFACS-i kodeerijate poolt. See andmestik loob ainulaadse eksperimentaalse keskkonna emotsioonide tuvastamise automatiseerimise erinevate lähenemisviiside uurimiseks, kusjuures emotsioonide määratlus on minimaalselt kallutatav. Andmed saavad veelgi kasu tõu standardiseerimise tõttu vähenes osalejate nägude morfoloogiline varieeruvus.
Vastavalt sellele36 on emotsionaalse või valuseisundi klassifitseerimiseks kaks standardset viisi: käsitsi valmistatud funktsioonide kasutamine või õpitud tunnustel põhineva sügava õppimise paradigma kasutamine51. Käsitsi valmistatud funktsioonid võib laias laastus jagada madala tasemega funktsioonideks, mis põhinevad kujutiste statistikal (nt orienteeritud gradientide histogrammid), mida tavaliselt kasutatakse arvutinägemise kirjanduses51, ja kõrgetasemelisteks funktsioonideks, mis on semantiliselt põhjendatud, liigiti. konkreetne anatoomiline näo- ja/või kehaehitus, grimassi skaalad, tegevusüksused jne. Viimaste näideteks on kassi näo maamärgid52, koera keha võtmepunktid47 või lambavalu tegevusüksused40. Need funktsioonid soodustavad masinõppe algoritmide seletatavust, rajades mudeli otsused käitumiskontseptsioonidele. Teisest küljest on süvaõppe lähenemisviis paindlikum ja eeldatavasti toimib paremini (eriti kui saadaval on suured andmestikud), kuid nõuab kulukaid arvutusressursse ja on "must kast" selles mõttes, et see ei sobi seletamiseks. inimlikult arusaadavalt, miks konkreetne klassifitseerimisotsus tehakse.
Selles uuringus uurime mõlemat alternatiivset viisi koerte emotsionaalsete seisundite automatiseeritud klassifitseerimiseks. Esimene marsruut kasutab DogFACS-i muutujaid seletatavate kõrgetasemeliste funktsioonidena. Klassifitseerimiskonveieril on sel juhul kaks etappi: esiteks DogFACS-koodide automaatne tuvastamine ja teiseks annotatsioonide kasutamine uuritud emotsioonide klassifitseerimiseks. Näitame sellise seletatava esituse kasulikkust, et mõista, kuidas DogFACS-i muutujaid kasutatakse masina otsuste tegemisel. Teine marsruut kasutab (lihtsamat, üheetapilisemat) süvaõppe lähenemisviisi, võimaldades masinal õppida otse andmefunktsioonidest, mis pole tingimata inimesele arusaadavad. Lisaks võrdleme kahe lähenemisviisi seletatavuse aspekte ja kasutame soojuskaardi visualiseerimise tehnikaid, et tuua esile õpitud tunnuste seos koera näoosadega seotud semantiliste objektidega.
Tulemused
Andmekogum.
Kasutasime andmestikku ja DogFACS-i annotatsioone, mis loodi osana eelmisest Bremhorsti jt uuringust22. Morfoloogilise varieeruvuse mõju vähendamiseks testiti 29 ühe tõu ekstreemsete näojoonteta katsealust (labradori retriiver) (19 emast – 13 kastreeritud, 10 isast – 9 steriliseeritud; vanusevahemik: 2–9,5 aastat, keskmine vanus {{9} }.22 aastat). Joonisel 1 on näidatud katsealuse vanuse ja soo jaotus.
Andmekogum sisaldas kokku 248 videonäidist pikkusega 3 sekundit, mis salvestati kaadrisagedusega 25,25 kaadrit sekundis ja iga kaadri eraldusvõime oli 1920 × 1080 pikslit. Salvestuskaameraks oli HIKVision, IR Mini Bullet Network Camera; salvesti: HIKVision, DS-7600 seeria. Katsealused asusid läbipaistva akna taga, kasutades protokolli, mida on täielikult kirjeldatud artiklis Bremhorst et al.22. Iga subjekti testiti 3 korda positiivse ja 6 korda negatiivse seisundi korral. Üldiselt märgiti kaks kolmandikku videotest negatiivseteks ja üks kolmandik positiivseteks. Selles uuringus eeldatakse, et negatiivne seisund kutsub esile frustratsiooni ja positiivne seisund positiivse ootuse, seega kasutame edaspidi positiivset/negatiivset valentsi, et viidata kahele emotsionaalsele seisundile. Joonisel 2 on kujutatud andmekogumist eraldatud koeranägude kärpeid.

Andmekogum tasakaalustati juhusliku alavalimi abil, jättes 82 videot positiivsetest tingimustest ja 82 videot negatiivsetest tingimustest (n = 29) isikult, kokku 164 videot. Tasakaalustamisel säilitati sama arv positiivseid ja negatiivseid proove inimese kohta.
Kõik videonäidised kodeeriti 39 DogFACS-i muutujaga, mis põhinesid DogFACS-i käsiraamatul53 sertifitseeritud DogFACS-kooderi poolt, lisades ühe kaadri 200 ms kohta, kasutades Solomon Coderit (versioon 15.03.15, Andràs Péter). Nendest 39 muutujast kasutati Bremhorsti22 uuringus ühtteist tabelis 1 esitatud muutujat, mis põhinevad vähemalt 10% esinemissagedusel kõigis positiivse või negatiivse seisundi proovides ja vähemalt olulisel interkodeerija kokkuleppel (vt 22). lisateabe saamiseks).

Ülevaade kahest lähenemisviisist.
Esitame siin kahe erineva lähenemisviisi võrdluse positiivsete ja negatiivsete tingimuste automatiseeritud klassifitseerimiseks: DogFACS-põhine vs. puhas (DogFACS-i lähenemisviisil on ka sügav õppemoodul DogFACS-i muutujate tuvastamiseks) süvaõppe lähenemisviis. Joonis 3 annab kõrgetasemelise ülevaate kahest lähenemisviisist.
Videoandmete kättesaadavus võimaldab meil töötada kahte tüüpi sisendiga: üksikud kaadrid või kaadrite jadad. Esimene tähendab suuremat teabekadu, kuid on lihtsam ja paremini kontrollitav; samas kui viimane sisaldab ajalist mõõdet, mis on osutunud selliste ülesannete jaoks oluliseks, nt hobuste valu tuvastamise kontekstis42,54. Levinud lähenemisviis loomade afektiivsete seisundite ja valu automaatse äratundmise kontekstis on siiski ühe kaadri alus (nt 33, 39, 41, 55). Selle uuringu uurimusliku iseloomu tõttu otsustasime selle variandi kasuks.
Mõlemad lähenemisviisid töötavad ühe kaadri põhimõttel, st klassifitseerimine toimub videotest eraldatud üksikute kaadrite alusel. Ühe kaadri teabe koondamine toimub kahel juhul aga erinevalt. Pärast eeltöötlusetappi, mille käigus eraldatakse raamidest kärbitud koeranäod (näiteid vaata jooniselt 2), võetakse süvalähenemise korral töötlemata kärbitud näod närvivõrgu sisendiks. Katsetame siin kahte tüüpi närvivõrgu arhitektuuridega: konvolutsiooniline närvivõrk (Resnet5056) ja hiljuti kasutusele võetud nägemistrafo57 (ViT) võrk. Valitud võrgu otsused liidetakse seejärel häälteenamusega ja tehakse video kohta klassifitseerimisotsus.
DogFACS-il põhinev lähenemisviis seevastu kasutab kahe järjestikuse etapiga torujuhet. Esimene on automaatne DogFACS-i muutujate detektor, mis tuvastab igas kaadris DogFACS-i muutujate komplekti. Seejärel koondatakse DogFACS-i muutujad kogu video jaoks. Teine samm on otsustuspuu, mille sisendiks on videos tuvastatud DogFACS-i muutujate kogum, mida rakendatakse lõpliku klassifitseerimisotsuse saavutamiseks.
Seega teeb DogFACS-põhine lähenemine klassifitseerimisotsuse videos tuvastatud DogFACSi muutujate komplekti põhjal; süvaõppe lähenemisviis seevastu otsustab iga kaadri kohta eraldi, eraldades õpitud funktsioonid töötlemata piltidest ja seejärel koondab otsuse video kõigi kaadrite jaoks. Seega, kui uurime kahe lähenemisviisi seletatavust, siis esimese puhul eeldatakse, et meil on Bremhorsti et al.22 sarnased "seletused" (mis tuvastab igas tingimuses levinud muutujad või nende kombinatsioonid). Siiski eeldatakse, et viimane lähenemisviis annab rohkem visuaalseid selgitusi selle kohta, millistele kujutise omadustele mudel keskendub, nagu allpool kirjeldatud.
Oma mudelite toimivuse hindamiseks kasutasime standardseid täpsuse, täpsuse ja meeldetuletuse mõõdikuid, mis on masinõppe kontekstis standardmeetod. Valideerimismeetodina kasutasime ristvalideerimist, mille puhul üks katseisik ei kattunud, mis tähendab, et iga koera katsealust kasutati eraldi testikomplektina. Seda meetodit soovitatakse andmekogude jaoks, milles ühel isikul on rohkem kui üks seotud valim36. Vt Broomé et al.36 sobiva valideerimismeetodi valimise tähtsuse kohta.

DogFACS-põhine lähenemine.
DogFACSi muutujate komplektid. Katsetasime kahe erineva DogFACS-i muutujate komplektiga:
1. Tabelis 1 esitatud üheteistkümnest muutujast koosnev kogum, mida kasutati Bremhorsti jt uuringus22, on kõige lootustandvamad või potentsiaalselt kõige olulisemad muutujad (mis põhineb vähemalt 10%-lisel levimusel kõigis kummagi riigi valimites). positiivne või negatiivne tingimus) ja neid saab usaldusväärselt kodeerida (vähemalt olulise interkodeerija kokkuleppega, vt 22).
2. Bremhorsti et al.22 uuringus kodeeritud 39 DogFACS muutuja kogu komplekt.
Classification results. To explore optimal performance, we used the manual DogFACS annotations from Bremhorst et al.22 to experiment with different machine learning techniques, including Decision Tree, XGBoost, and Random Forest. Table 2 presents a comparison of their performance, with Random Forest performing slightly better for the full set of DogFACS variables (39 variables), reaching accuracy > 71%. In the limited set (11 DogFACS variables), the three models converged to one tree, and thus are presented together, reaching a slightly lower accuracy of > 66%.
Otsuste puu minimeerimine. Järgmisena otsisime süstemaatiliselt minimaalset DogFACS-i muutujate komplekti, mis annaksid samasugused tabelis 2 toodud klassifikatsioonijõudlused. Tabel 3 näitab, et ainult ühe DogFACS-i muutuja kasutamine funktsioonina tagab sarnase jõudluse tabelis 2 esitatud näitajaga. Muutuja 'Ears Flattener' on kõige olulisem klassifitseerimisel, kasutades piiratud hulka 11 DogFACS-i muutujat, selle olemasolu ennustab negatiivset seisundit. Joonisel 4 on kujutatud lihtsustatud otsuste puud, millel on ainult üks omadus, mis ennustab positiivset tingimust - "Kõrvade lamendaja" puudumine ja negatiivne tingimus - selle olemasolu (täpsusega > 66%).
Eelkõige, võttes arvesse kõiki 39 DogFACS-i muutujat, on „Eyes Up” kõige olulisem muutuja klassifitseerimisel, kasutades kõiki 39 muutujat, selle olemasolu ennustab positiivseid tingimusi suure täpsusega > 71%.
DogFACS-i muutujate automaatne tuvastamine. Meie leidude põhjal piisab täielikult automatiseeritud klassifitseerimiskonveieri jaoks detektori koolitamisest DogFACS muutujate kõrvade lamendaja ja silmad üles jaoks. Uurisime ka teiste muutujate tuvastamist, kasutades tasakaalustatud andmekogumitel eelkoolitatud ResNet50 konvolutsioonilist närvivõrku (erineva arvu piltide puhul DogFACS-i muutuva sageduse varieeruvuse tõttu). Saadud detektorite jõudlus on toodud tabelis 4.

Sügav lähenemine.
Selle lähenemisviisi puhul kasutasime tavalist "ülekande õppimise" seadistust, treenides lineaarset sondi fikseeritud eelkoolitatud selgroo peal, kasutades inimese annotatsioone. Uurime erinevate selgroogude sobivust selle ülesande täitmiseks, korrates katset nelja eelkoolitatud selgrooga: ResNet ja ViT, mis on koolitatud kas piltide klassifitseerimiseks57 või iseseisvalt, kasutades DINO58.
Koolitasime nelja erinevat mudelit (kogu andmestiku kohta) ja testisime nende toimivust, kasutades kaadreid samast tasakaalustatud andmestikust, mida on kirjeldatud ülal (82 videot negatiivsest seisundist, 82 videot positiivsest seisundist (n = 29) isikult, tehes kokku 164 videot).
Tabelis 5 on esitatud video kohta analüüsitud klassifitseerimise tulemused, st me ütleme, et video klassifitseeritakse õigesti, kui enamik selle kaadreid on õigesti klassifitseeritud. On näha, et DINO-ViT selgrooga treenitud mudel näitab parimat jõudlust üle 89% täpsusega. Tabelis 6 on esitatud kaadrite kaupa analüüsitud klassifitseerimise tulemused. Ootuspäraselt on antud juhul mõõdud mõnevõrra vähenenud võrreldes kaadri liitmise analüüsiga, mille tulemuseks on 85% täpsus DINO-ViT põhivõrguga treenitud mudeli puhul.

Arutelu
The present study is the first to explore automated recognition of canine emotional states focusing on diverse facial expressions, whilst using a carefully designed controlled experimental setup for dataset creation and annotation. We present classifiers of two different types: deep learning-based and DogFACS-based, both having a performance that is comparable to and in some cases outperforms those presented in previous studies addressing recognition of pain or emotional state from facial expressions, including mice38,39 (> 89% and 93% respectively), cats43 (> 72%), horses42,46 (> 75% and 65% respectively) and sheep55 (> 64%).
The DogFACS-based approach described here reached an accuracy of > 71% using the full set (n = 39) of DogFACS variables, but a lower accuracy of > 66% when using only the eleven DogFACS variables which were utilized in the study of Bremhorst et al.22 ( this accuracy was achieved based on manual DogFACS annotations and is expected to drop even lower in an end-to-end pipeline). Of the full set of 39 DogFACS variables, 'Eyes Up' were of considerable importance for classification, and including them in the Decision Tree leads to higher accuracy (>71%). Suunamuutujate, näiteks silmade liikumise ja nende olulisuse tõlgendamisel potentsiaalsete emotsiooninäitajatena tuleb aga alati arvestada uuringu eksperimentaalset ülesehitust, mille käigus andmed koguti. Artiklis Bremhorst et al.22 andis katsetaja toidutasu kätte liigutusega, mis oli veidi koerte silmapliiatsi kohal. See võis julgustada koeri toidu ootuses üles vaatama (indutseerides muutuja "Eyes Up"). Seetõttu peame tunnistama, et see DogFACS-i muutuja võib olla eksperimentaalse protseduuri artefakt. Emotsiooninäitajate väljatöötamise osana muutujate valimisel on oluline kaaluda I tüüpi vea (valepositiivne) ja II tüüpi vea (valenegatiivne) risk on peaaegu vältimatu. Töötades üheteistkümnest DogFACS-i muutujast koosneva vähendatud komplektiga, seadsime prioriteediks valepositiivsete väärtuste vältimise, et mitte jätta muutujat edasisest uurimisest enneaegselt välja. Võime eeldada, et ekslikult aktsepteeritud muutujad jäetakse järgmistes uuringutes välja, kui tuvastatakse nende ennustava kehtivuse puudumine (nagu on arutatud punktis 19).
As a byproduct of these results, we obtained automated detectors for nine DogFACS variables, of which five performed with an accuracy >70%, mis näitab DogFACS-i muutujate täpse automaatse tuvastamise teostatavust. Peamiseks väljakutseks iga muutuja detektorite väljaõppel on andmete kättesaadavus, st mõnede DogFACS-i muutujate madal esinemissagedus, mis nõuab keskendunud jõupingutusi konkreetsete muutujate jaoks andmekogumite kogumiseks. Lisaks on mõnedel muutujatel ajaline mõõde ja neid ei saa käsitleda ühe kaadri alusel (nt silmade pilgutamine või hingeldamine). Nende jaoks detektorite väljatöötamiseks on vaja mudeleid, mis kasutavad ka ajalist dünaamikat, näiteks Broomé jt lähenemisviis42.
Lisaks tuleb märkida, et kuna meie andmestik piirdub ühe tõuga, on lähituleviku uurimisvajaduseks mudelite üldistavuse hindamine teistele tõugudele. Kui tulemuslikkus langeb oluliselt tulemuste ülekandmisel teistele tõugudele, on näidatud alternatiivsed lähenemisviisid siin kasutatud sügavale lähenemisele, nt Feighelstein et al.43.

Siin esitatud mudelite üldistavuse uurimine on oluline mitte ainult DogFACS-i muutujate tuvastamise, vaid ka emotsioonide klassifitseerimise kontekstis. Siin kasutatavat andmekogumit ei kontrollita mitte ainult tõu kohta, vaid see registreeritakse ka rangelt kontrollitud keskkonnatingimustes. Kontrollitud keskkondadelt naturalistlikele seadistustele üldistamine on kurikuulsalt keeruline väljakutse ka inimeste afektiivses andmetöötluses60. Feng jt.61 annavad ülevaate inimvaldkonnast, kuidas ülekande õppimistehnikad saavad ületada väljakutseid, mis on seotud piiratud andmekoguste, nappide siltide ja keskkonnamuutustega, edendades tugevaid ja üldistavaid automatiseeritud süsteeme emotsioonide tuvastamiseks. Sarnaseid viise saab uurida koerte afektiivses andmetöötluses; siin esitatud tulemused annavad lähtealuse selle suuna edasiseks uurimiseks.
Sellised küsimused nagu "Kas masinad suudavad ära tunda loomade emotsionaalset seisundit?" on omaette huvitavad ja neil on loomade heaoluks kaugeleulatuvad praktilised rakendused. Meie uuringu tulemused viitavad positiivsele vastusele, vähemalt positiivse pettumuse ja ootuse korral koertel. Koerte emotsioone ära tundvate tehisintellekti mudelite ehitamisel on aga märkimisväärne lisaväärtus, aidates meil mõista, kuidas masinad emotsioone klassifitseerivad, kas need on tundlikud nüansside suhtes, mida inimekspert ei näe, ning millist mõju see avaldab meie arusaamale loomade emotsioonidest ja jätkuvast. arutelud loomade tundlikkuse üle. Sel põhjusel on ülioluline ja paljutõotav uurida seletatavust (mis on masina otsuse põhjendus?) ja tõlgendatavust (kuidas on mudeli struktuur sellise otsuse tegemisega seotud?)62. Need teemad on tehisintellektis fundamentaalsed ja neid käsitleb tohutu hulk uuringuid63–65, kusjuures suurem osa jõupingutustest keskendub süvaõppe lähenemisviisidele, mille tõlgendatavust piirab nende keeruline struktuur66. Seletatavusmeetodid on oma olemuselt valdkonnapõhised: isiksuseomaduste automatiseeritud äratundmise selgituste esitamine tööintervjuudel erineb nt meditsiiniliste otsuste kliinilisest põhjendusest62.

Meie uuring on esimene, mis käsitleb loomade emotsioonide tuvastamise tehisintellekti mudelite seletatavust. Võrreldes kahte erinevat lähenemist emotsioonide klassifitseerimisele, annab lisaväärtust võimalus võrrelda ka nende poolt käsitletavate seletatavuse aspektide erinevusi. DogFACS-il põhinev lähenemine viib mudeliteni lihtsate otsustuspuude kujul, mis modelleerivad inimese loogilist arutluskäiku Boole'i tingimuste kombinatsiooni kujul, mis puudutavad teatud DogFACS-i muutujate olemasolu/puudumist. Otsustuspuude selgitav olemus kajastub eriti nende lihtsustatud versioonis, millel on ainult üks sõlm, näiteks siin uuritud versioon (koos „Kõrvade lamendajaga”). Sellised puud on tihedalt seotud inimekspertide jaoks kasulike kontseptsioonidega, eriti Bremhorsti jt poolt uuritud emotsiooninäitajate jaoks19. Kehtivad emotsioonindikaatorid on mõeldud konkreetse emotsionaalse seisundi täpseks tuvastamiseks, mis on olemas alati, kui emotsioon on olemas, ja puudub muul viisil.
Neid omadusi kirjeldavad tundlikkus ja spetsiifilisus – mõõdikud, mida tavaliselt kasutatakse diagnostiliste testide täpsuse hindamiseks. Bremhorst et al.19 leidsid, et ühtegi uuringus käsitletud DogFACS-i muutujatest ei saa pidada konkreetseks individuaalseks indikaatoriks positiivse ootuse või pettumuse kohta koertel. Täpsemalt, 'Ears Flattener' oli suhteliselt kõrge tundlikkusega, kuid madala spetsiifilisusega. Seega pole üllatav, et meie uuringus kirjeldatud mudel, mis on otsustuspuu, millel on üks funktsioon "Ears Flattener", ei saavutanud kõrget jõudlust. Bremhorsti jt poolt19 kasutatud emotsiooninäitajate mõõdikute ja siin meie mudeli toimivuse hindamiseks kasutatud mõõdikute vaheline seos ei ole aga lihtne. Kui esimene arvutab tundlikkuse, spetsiifilisuse ning positiivse ja negatiivse ennustusväärtuse kogu tasakaalustamata andmete jaoks, siis teine hindab ennustusülesande toimivust. See tähendab, et andmed on jagatud kaheks osaks: koolitus, mida kasutatakse mudeli koolitamiseks, ja testimine selle toimivuse hindamiseks. Erinevalt Bremhorstist jt19 tasakaalustasime andmeid ka alavalimi abil. Intuitiivne seos nende kahe vahel seisneb aga selles, et kui eelmist lähenemist kasutades leiti suurepärane emotsiooninäitaja, võiksime eeldada, et ka seda funktsioonina kasutav otsustuspuu saavutab suurepärase jõudluse.
Lisaks seletatavusele võib siin esitatud masinõppe lähenemisviis optimaalsete otsustuspuu mudelite otsimiseks koerte emotsioonide ennustamiseks anda potentsiaali uute teadmisteni emotsiooninäitajate kohta. Nagu ülalpool mainitud, on täpsete emotsiooninäitajate avastamine Bremhorsti jt poolt19 tihedalt seotud probleemiga leida emotsioonide ennustamiseks ühe DogFACS-i muutujaga otsusepuu klassifikaatorid. Kuigi meie uuringus ei ole sellistel klassifikaatoritel näidatud suurt täpsust (ja tõepoolest, täpseid emotsioonindikaatoreid pole avastatud19), saab klassifitseerimise toimivust parandada otsustuspuude keerukamate vormide kaalumisel, näiteks rühmitades DogFACS-i muutujad paaridesse. , kolmikud jne. Meie esialgsed katsed, milles kasutati sõlmedena DogFACS-i muutujate paare, mis on näidatud joonisel 5, näitavad, et see parandas mudeli jõudlust meeldetuletuse osas. Oluline on see, et uurida, millised DogFACS-i muutujate kombinatsioonid võivad klassifitseerimist parandada, saab läbi viia automatiseeritud, ammendavalt ja süstemaatiliselt, mis võib viia emotsiooninäitajate peeneteralisemate arusaamadeni. See annab paljutõotava tee tulevaste uuringute jaoks.
Teisest küljest saavutas sügava õppimise lähenemisviis märkimisväärselt kõrgema tulemuse, üle 89%, mis näitab selliste lähenemisviiside potentsiaali emotsioonide klassifitseerimisel. Veelgi enam, DINO-ViT selgroog näib kõigist neljast uuritud võimalusest kõige sobivam emotsioonide klassifitseerimise ülesandeks. Me oletame, et see on tingitud sellest, et DINO-ViT funktsioonid on tundlikud objekti osade suhtes, nagu on näidatud joonisel 67; ja emotsioonide klassifitseerimise ülesande olemuse tõttu nõuab mõistmist objekti-osa tasandil (näoosad, nagu silmad, kõrvad jne). Huvitaval kombel annavad DINOga eelkoolitatud selgrood paremaid tulemusi kui järelevalve all olevad selgroog.
Tuleb märkida, et süvaõppe klassifikaator töötas piltide põhjal, seejärel koondas tulemused video kohta. See tähendab, et vaatamata sellele, et paljudes kaadrites ei esine DogFACS-i muutujaid, on mudel siiski edukas nende õiges klassifikatsioonis. See võib viidata mudeli tundlikkusele peeneteraliste detailide suhtes pikslitasandil, mis võib ületada inimsilma võimeid. Siiski võib see olla seotud ka võimalike lõksudega teatud loomupärase eelarvamuse näol. Samuti võis ülalpool käsitletud muutuja "Eyes Up" olla võrgustiku jaoks oluline ja selle mõju otsuste tegemisele ei ole süvaõppe võrgustikus kergesti neutraliseeritav. Nende probleemide uurimine nõuab täiendavat andmete kogumist erinevates katse- ja keskkonnatingimustes, et selliseid lõkse välistada.
Seevastu siin käsitletud süvaõppe lähenemisviisi seletatavus on DogFACS-il põhinevaga võrreldes hoopis teistsugune, visuaalsem. Erinevalt otsustuspuu mudelitest on närvivõrkude otsustamise inimesele arusaadavalt seletamine äärmiselt keeruline, kuna need on väga keerulised, nn musta kasti laadi68. EigenCAM59 meetodi kasutamine toob esile erinevused erinevate mudelite vahel, millega katsetasime (ResNet / ViT, juhendatud / DINO). Nagu on näidatud joonisel 6, on mudelite vahel mõningaid erinevusi. Näib, et Te ViT mudelitel on parem lokaliseerimine kui ResNeti mudelitel, kuna tugevalt aktiveeritud piirkonnad (tähistatud punasega) on väiksemad ja asuvad silmapaistvamatel piirkondadel (nt silmad, kõrvad, nina, mitte nahk). Pealegi näib, et DINO-ViT mudel aktiveerub pigem mitmes silmatorkavas piirkonnas kui ühes (nt aktiveeritakse pigem kõrvades, silmades ja ninas, mitte ainult kõrvades üleval paremal näitel). Me omistame ViT-põhiste mudelite edu ViT-de võimele pakkuda lokaliseeritud signaali kui ResNeti mudelid. See tuleneb nende arhitektuurist - ViT-funktsioonide eraldusvõime jääb kihtide lõikes muutumatuks, samas kui CNN-i funktsioonide eraldusvõime väheneb, kui kihid muutuvad sügavamaks.
Kuigi lõplike järeldusteni jõudmine nõuab täiendavat uurimistööd, katsetasime EigenCAM-meetodit, keskendudes meie tähelepanu kaadritele, mis vastavad järgmistele tingimustele: (i) käsitsi kodeeritud muutujaga „Ears Flatterer” ja (ii) kuuluvad videonäidiste klassi. negatiivne seisund ja (iii) DINO-ViT võrgu poolt õigesti negatiivseks tingimuseks klassifitseeritud. Analüüsis jagasime näited kolme kategooriasse, nagu on näidatud joonisel 7. A-kategooria näited on soojuskaardid, mis keskenduvad selgelt ainult kõrvadele. Seda võib pidada kooskõlas DogFACS-iga seotud kõrvade lamendaja seletusega, st võib juhtuda, et mudel õppis kõrva liikumisega seotud mustreid. Sellega on kooskõlas ka B-kategooria, mis näitab soojuskaarte, mis keskenduvad nii kõrvadele kui ka muudele piirkondadele, nagu silmad, otsmik, nina ja suu. Viimane võib olla kaudselt seotud ka liikumisega „Ears Flatterer”, aga ka teiste DogFACS-i muutujatega või mõne muu asenditunnusega, mis kaadris esineda võib. Kõige intrigeerivam kategooria on aga C-kategooria: siin võtab mudel vastu signaale muudest näoosadest peale kõrvade, tehes siiski õige klassifikatsiooni. Need juhtumid võivad olla võtmeks, et mõista võrgu tundlikkust inimsilmale mittenähtavate nüansside suhtes. Igal juhul tuleb märkida, et DogFACS-i annotatsioonid ei saa ammendavalt hõlmata kõiki võimalikke muutusi näo käitumises, mis võivad peegelduda pikslimustrites, mille suhtes võrk on tundlik. Seejärel ekstraheerisime soojuskaardid ka videotest, millel ei olnud annoteeritud DogFACS-i muutujaid. Seal oli üheksa muutujateta videot, neist kaheksa "positiivne" ja üks "negatiivne". Hämmastav on see, et enamik neist videotest (77%) oli mudeli järgi siiski õigesti klassifitseeritud. See võib olla veel üks märk sellest, et mudel on märganud näo peent käitumist, mida DogFACS ei tabanud. Nende videote kaadrite jaoks loodud soojuskaarte uurides täheldasime, et mudeli põhirõhk oli nina-suu piirkonnas. Mõned teised kaadrid näitavad fookust teistele näoosadele, samas on juhtumeid, kus kaadrid on õigesti klassifitseeritud, kuid udused ja ebaselged soojuskaardid. Nende kolme kategooria näited on toodud joonisel 8. Huvitaval kombel ei keskendu need soojuskaardid konkreetsetele näoosadele, mis viitab sellele, et nendel juhtudel olid visuaalsed näpunäited mudeli jaoks vähem ilmsed.


Teine tähelepanuväärne probleem, mis on seotud mõlema lähenemisviisiga jõudluse osas, on praeguses andmestikus olevate videote lühike pikkus (3 s). Pikemate videote kasutamine toob kaasa väljakutse leida optimaalne ajaaken, mille jooksul võib sisemist olekut pidada konstantseks. Seda probleemi on käsitletud 69 hobuste nõrga ortopeedilise valu kontekstis ning see on oluline suund tulevastes uuringutes ka koerte emotsionaalsete seisundite osas.
Kokkuvõtteks võib öelda, et see uuring näitas kahe erineva automatiseeritud klassifitseerimismeetodi väärtust koerte kahe emotsionaalse seisundi jaoks nende näoilmete põhjal: positiivne vs negatiivne seisund. Mõlemad saavutasid loomade mõjude automatiseeritud tuvastamisel hea täpsuse, mis on võrreldav teiste nüüdisaegsete meetoditega. Need tulemused ei anna mitte ainult esimest korda jaatavat vastust küsimusele "Kas masinad suudavad ära tunda positiivseid/negatiivseid koera emotsioone?", vaid avavad ka uusi uurimisteid, et uurida, kuidas masinad neid ära tunnevad ja kuidas seda äratundmist inimestele seletatavaks teha. . Täiendav katsetamine suuremate ja laiemate osalejaomadustega andmekogumitega soodustab ka meie arusaamist loomade heade emotsiooninäitajate väljatöötamisest. Üks konkreetne suund, mis tundub eriti paljutõotav, on näo maamärkide tuvastamisega seotud lähenemisviiside potentsiaali uurimine, nagu OpenFace70 ja Google MediaPipe71. Sarnaseid lähenemisviise hakatakse alles uurima ka loomade puhul, kes ei ole inimesed, vt nt Feighelsteini jt uuringut43 kasside nägude kohta. Sarnaselt inimvaldkonnaga nõuab nende arendamine ulatuslikke multidistsiplinaarseid jõupingutusi erinevate liikide jaoks suurte andmekogumite kogumiseks.
meetodid
Andmekogum.
Selles uuringus kasutatud koertega seotud andmestik koguti eelnevalt Lincolni ülikooli järgmiste eetiliste kinnituste alusel (UID: CoSREC252) vastavalt Bremhorstile jt.22 ning selle uuringu muudatus saadi Lincolni ülikoolist. kasutades käesolevas uuringus algset andmekogumit. Haifa ülikooli eetikakomitee vaatas praeguse neid andmeid kasutava protokolli läbi ja täiendavat heakskiitu polnud vaja.
Kärpimine ja eeltöötlemine.
See samm on asjakohane nii DogFACS-i kui ka sügavate lähenemisviiside jaoks. Algsed videokaadrid sisaldavad tausta segadust, sealhulgas ümbritsevat ruumi, inimesi, koera kehasid jne. Meie eesmärk on keskenduda koerte näoilmetele ja vältida teiste emotsionaalse seisundi ennustajate (nt koera kehaasendid) õppimist. Seetõttu treenisime mask-RCNN72 koerte nägude tuvastamiseks ja kasutasime seda igal pildil näopiirdekasti kärpimiseks. Koolitasime Mask-RCNN-i selle andmekogumi umbes 200 kommenteeritud pildiga, muutes selle selle konkreetse eksperimentaalse seadistuse jaoks kõige sobivamaks. Näiteid eeltöötlusetapi abil saadud näokultuuridest on näha joonisel 2.
DogFacsil põhinev lähenemine.
Alates videotest kuni DogFACSi muutujateni. Kogu torujuhet on kirjeldatud järgmisel diagrammil, vt joonis 9. See sisaldab järgmisi samme:
• Koera nägude kärpimine raamidest välja, kasutades ülalkirjeldatud meetodit.
• DogFACS-i muutujate andmekogumite loomine Kasutades Bremhorsti jt 22 käsitsi DogFACS-i kodeerimist, lõime iga DogFACS-muutuja jaoks kaks kausta positiivsete ja negatiivsete näidetega (koera nägu kas väljendab või ei väljenda seda DogFACS-muutujat). Positiivsete proovide jaoks (olemas muutuja) valisime kõigi selle muutujaga käsitsi kodeeritud kaadrite kujutised. Negatiivsete näidiste jaoks valisime videote kaadrid, mille kodeerimisel ei olnud muutujat märgitud kuni muutuja esmakordse ilmumiseni (või video lõpuni, kui seda pole). Seejärel tasakaalustati andmekogumid, jättes iga muutuja jaoks positiivsete ja negatiivsete näidete jaoks võrdse arvu pilte. Tabelis 4 on näidatud kõigi DogFACS-i muutujate andmekogumite suurus, mille jaoks detektorid saadi.
Alates DogFACS-i muutujatest kuni emotsionaalsete seisundite klassifikatsioonini. Kasutasime ülekandeõpet, mis põhines eelkoolitatud ResNet5{4}} võrguarhitektuuril, mis oli lähtestatud Imageneti kaaludega. Asendasime selle ülemise kihi keskmise basseinikihi, 20-protsendilise väljalangemise kihi ja kahe klassi klassifikaatori kihiga. Mudelit treeniti 20 perioodi jooksul, kasutades Adami optimeerijat, mille õppimiskiirus oli 0,0001. Parimaks mudeliks valiti mudel, mis saavutas valideerimisandmestiku maksimaalse täpsuse. Esimese 10 epohhi jooksul viidi kõigi kihtide raskused täpselt paika. Esimese 10 epohhi jooksul oli kõigi kihtide kaal peenhäälestatud. Ülejäänud epohhide ajal külmutati ResNet50 kaalud ja värskendati ainult uute pealiskihtide kaalu. Orientatsiooniga mitteseotud muutujate jaoks ('kõrvade lamendaja', 'huulte osa', 'kõrvade liiteseade', 'kõrvad ettepoole' ja 'nina lakkumine') rakendasime suurendamistehnikat, mis põhines juhuslikul kujutise horisontaalsel kallutamisel ja pööramisel kuni 20 kraadi. Kodeerija sisendina kasutasime sisendtabelit, kus iga rida tähistab iga video 11 DogFACS-i muutuja olemasolu (1) / puudumist (0). Kodeerija sihtmärk on tabel, mis sisaldab iga video tingimust (negatiivne(0)/positiivne(1)).

Sügav lähenemine.
Kuni viimase ajani peeti konvolutsioonilisi närvivõrke (CNN) arvutinägemise ülesannete tipptasemel. Hiljuti kerkis alternatiivina esile Vision Transformer (ViT)57 arhitektuur73. DINO meetod koolituseks on võetud kasutusele alles 2021. aastal isedestilleerimise õpperaamina. Mitmete DNN-i magistraalide (ResNet50, visit-small, vit-base jne) treenimine selles konfiguratsioonis näitas, et DINO-lähenemisega treenitud ViT magistraal toimib varasematest ImageNeti standardse andmestiku74 klassifitseerimise tulemustest.
Kasutasime ResNet5{11}} arhitektuuri järelevalvega ja DINO-koolitusega magistraalvõrkude jaoks; ViT-S/16 treeniti juhendatud viisil ja ViT-S/8 DINOga. Kasutame eelkoolitatud ViT raskusi Timmi raamatukogust75. Koolitame kõiki nelja mudelit 30 epohhi jaoks, kasutades Adam Optimer76 beetaversioonide=(0, 0,999) ja õppimiskiirustega: 10–4 ResNeti magistraalide ja 5 · 10–6 ViT magistraalide jaoks. Treenitud mudelite kadukõverad on toodud joonisel 10.
Kaardi visualiseerimine.
Valime Eigen-CAM meetodi59, et visualiseerida iga mudeli lõplike aktiveerimiste peamised komponendid. On näidatud, et Eigen-CAM pakub teiste CAM-meetoditega, näiteks populaarse Grad-CAM77-ga võrreldes lihtsamini tõlgendatavaid tulemusi väiksema arvutustööga. Lisaks, erinevalt teistest visualiseerimismeetoditest, nagu Grad-CAM59 ja Grad-CAM{8}}, on Eigen-CAM klassist sõltumatu tööriist. See omadus võimaldab Eigen-CAM-il visualiseerida õpitud mustreid isegi siis, kui mudeli ennustus on vale, erinevalt vanematest CAM-meetoditest, mis toodavad ebaolulisi kaarte, kui nende ennustus on vale. See EigenCAM-i omadus võimaldab tõlgendada ennustamise ebaõnnestumise põhjuseid. Võrreldes teiste nüüdisaegsete visualiseerimismeetoditega on see järjekindlam ja klasse eristavam. Lisaks ei ole EigenCAM mudelispetsiifiline - seda saab kasutada nii ViT-de kui ka CNN-ide jaoks ilma kihte muutmata.
Andmete kättesaadavus
Selles artiklis kasutatud andmestik on saadaval vastava autori nõudmisel.
Viited
Darwin, C. Te Emotsioonide väljendamine loomades ja inimestes, Vol. 11, 1872 (Murray, 1872).
2. Ekman, P. & Friesen, WV Näo liikumise mõõtmine. Keskkond. Psychol. Mitteverbaalne käitumine. 1, 56–75 (1976).
3. Ekman, P. & Keltner, D. Emotsioonide universaalsed näoilmed. Teoses Nonverbal Communication: Kus loodus kohtub kultuuriga (eds Segerstrale UP & Molnar, P.) vol. 27, 46 (1997).
4. Russell, JA, Bachorowski, J.-A. & Fernández-Dols, J.-M. Emotsioonide näo- ja hääleväljendused. Ann. Rev. Psychol. 54, 329–349 (2003).
5. Diogo, R., Abdala, V., Lonergan, N. & Wood, B. Fsh-st tänapäeva inimeseni – pea ja kaela lihaskonna võrdlev anatoomia, homoloogiad ja areng. J. Anat. 213, 391–424 (2008).
6. Descovich, KA jt. Näoväljendus: alakasutatud tööriist imetajate heaolu hindamiseks (Altex, 2017).
7. Mota-Rojas, D. jt. Praegused edusammud koerte emotsioonide, näoilmete ja nende kasutamise kohta valu kliiniliseks äratundmiseks. Loomad 11, 3334 (2021).
8. Ekman, P. & Friesen, WV näotegevuse kodeerimissüsteem: käsiraamat (Consulting Psychologists Press, 1978).
9. Ekman, P. & Friesen, W. Näotegevuse kodeerimissüsteem: näo liikumise mõõtmise tehnika (1978).
For more information:1950477648nn@gmail.com






