Skúmanie samoobslužných transformátorov videnia na rozpoznávanie chôdze v divočine, časť 1
Nov 24, 2023
Abstrakt:
Spôsob chôdze (chôdza) je výkonná biometria, ktorá sa používa ako jedinečná metóda snímania odtlačkov prstov, ktorá umožňuje vykonávať nenápadnú analýzu správania na diaľku bez spolupráce subjektu.
Všetci vieme, že cvičenie pomáha dobrému zdraviu. Okrem toho cvičenie pomáha zlepšovať pamäť. Chôdza je najjednoduchšia a najľahšia forma cvičenia na cvičenie a mnohí ľudia radi relaxujú pri chôdzi alebo joggingu. Teraz viac výskumov ukazuje, že chôdza robí pre mozog silné veci.
Po prvé, chôdza stimuluje nervový systém mozgu, čo pomáha posilňovať mozgové funkcie. Keď sa telo hýbe, naša srdcová frekvencia a prietok krvi sa zvyšujú, čo tiež stimuluje mozog, aby produkoval viac neurónov a synapsií. Spojenia medzi týmito neurónmi a synapsiami môžu vytvárať nové neurónové siete a rýchlejšie myšlienkové procesy.
Po druhé, chôdza môže zmierniť stres a úzkosť, čo je veľmi dôležité pre zlepšenie pamäte. Keď sú myseľ a telo v stave napätia, depresie alebo úzkosti, mozog uvoľňuje hormón nazývaný kortizol. Kortizol poškodzuje neuróny a synapsie v mozgu, čo môže viesť k strate pamäti. Chôdza zmierňuje stres a úzkosť, znižuje produkciu kortizolu v tele a pomáha udržiavať zdravé neuróny a synapsie.
Nakoniec chôdza zvyšuje krvný obeh v mozgu. Niektoré štúdie ukazujú, že dobrý krvný obeh môže pomôcť zlepšiť pamäť. Ako starneme, cievy v mozgu sa postupne upchávajú, čo má za následok nedostatočné zásobovanie mozgu kyslíkom. Chôdza môže zlepšiť zdravie srdca, čo umožňuje srdcu efektívnejšie dodávať kyslík a živiny do mozgu, čím podporuje pamäť a funkciu mozgu.
Preto je chôdza skvelou formou cvičenia pre malých aj veľkých. Okrem zlepšenia fyzického zdravia môže chôdza tiež pomôcť zlepšiť pamäť. Prejdime každý deň vzdialenosť, aby sme boli zdravší a lepší! Je vidieť, že potrebujeme zlepšiť pamäť a Cistanche deserticola môže výrazne zlepšiť pamäť, pretože Cistanche deserticola je tradičný čínsky liečivý materiál, ktorý má mnoho jedinečných účinkov, jedným z nich je zlepšenie pamäte. Účinnosť mletého mäsa spočíva v rôznych aktívnych zložkách, ktoré obsahuje, vrátane kyselín, polysacharidov, flavonoidov atď. Tieto zložky môžu podporovať zdravie mozgu rôznymi spôsobmi.

Kliknite na spoznajte 10 spôsobov, ako zlepšiť pamäť
Na rozdiel od tradičnejších biometrických metód autentifikácie si analýza chôdze nevyžaduje explicitnú spoluprácu subjektu a môže sa vykonávať v nastaveniach s nízkym rozlíšením bez toho, aby bolo potrebné, aby bola tvár subjektu bez prekážok/viditeľná. Väčšina súčasných prístupov sa vyvíja v kontrolovanom prostredí s čistými anotovanými údajmi podľa zlatého štandardu, ktoré poháňali vývoj neurónových architektúr na rozpoznávanie a klasifikáciu.
Len nedávno sa analýza chôdze odvážila používať rôznorodejšie, rozsiahlejšie a realistickejšie súbory údajov pre vopred vyškolené siete spôsobom, ktorý sa vykonáva pod dohľadom. Tréningový režim s vlastným dohľadom umožňuje naučiť sa rozmanité a robustné reprezentácie chôdze bez drahých manuálnych ľudských poznámok. Na základe všadeprítomného používania modelu transformátora vo všetkých oblastiach hlbokého učenia, vrátane počítačového videnia, v tejto práci skúmame použitie rôznych architektúr transformátorov videnia priamo aplikovaných na rozpoznávanie chôdze s vlastným dohľadom.
Prispôsobujeme a rekvalifikujeme jednoduché ViT, CaiT, CrossFormer, Token2Token a TwinsSVT na dvoch rôznych rozsiahlych súboroch údajov o chôdzi: GREW a DenseGait. Poskytujeme rozsiahle výsledky pre nulový záber a jemné ladenie na dvoch referenčných súboroch údajov na rozpoznávanie chôdze, CASIA-B a FVG, a skúmame vzťah medzi množstvom priestorových a časových informácií o chôdzi, ktoré využíva vizuálny transformátor.
Naše výsledky ukazujú, že navrhovanie modelov transformátorov na spracovanie pohybu využíva hierarchický prístup (tj modely CrossFormer) na jemnozrnnejších pohybových veľtrhoch porovnateľne lepšie ako predchádzajúce celoskeletové prístupy.
Kľúčové slová:
rozpoznávanie chôdze; biometrické overovanie; transformátor videnia; odhad pozície; učenie s vlastným dozorom; kontrastné učenie.
1. Úvod
To, ako sa pohybujeme, obsahuje významné stopy o nás samých. Najmä naša chôdza (spôsob chôdze) bola podrobne študovaná v medicíne [1], psychológii [2] a športovej vede [3]. V poslednej dobe sa analýze chôdze venuje zvýšená pozornosť [4,5] zo strany počítačovej komunity, čo sa zhoduje s exponenciálnym pokrokom hlbokého učenia a rozšírenou dostupnosťou výpočtového hardvéru.
Systémy analýzy chôdze poháňané AI boli schopné úspešne rozpoznať subjekty [6–10], odhadnúť demografické údaje, ako je pohlavie a vek [11], a odhadnúť vonkajšie atribúty, ako je oblečenie [12], bez použitia akýchkoľvek vonkajších znakov vzhľadu. Tieto výsledky nie sú prekvapujúce vzhľadom na veľké množstvo individuálnych rozdielov v chôdzi, ktoré sú spôsobené rozdielmi v muskuloskeletálnej štruktúre, genetických a environmentálnych faktoroch, ako aj v emocionálnom stave a osobnosti chodca [13].
Súčasné systémy sú skutočne trénované a testované iba v kontrolovanom vnútornom prostredí. Väčšina metód používa súbor údajov CASIA-B [6] ako štandardný štandard pre modely rozpoznávania chôdze, ktorý obsahuje 124 subjektov kráčajúcich v interiéri prísne kontrolovaným spôsobom zachytených viacerými kamerami. Zložitosť v reálnom svete nie je možné plne modelovať takýmito obmedzenými scenármi. Len nedávno sa pozornosť sústredila na modelovanie chôdze „vo voľnej prírode“ pomocou súborov údajov ako DenseGait [12], GREW [7] a Gait3D [14].

Zhromažďovanie rozsiahleho súboru údajov, ktorý je čistý a plne anotovaný, predstavuje obrovské úsilie z hľadiska finančných zdrojov aj prideleného času. Zhromažďovanie a anotovanie súboru údajov GREW [7] údajne trvalo 3 mesiace nepretržitej práce. Zatiaľ čo takéto prístupy boli užitočné pri vývoji neurónových architektúr na spracovanie chôdze [8,9], nie sú dostatočne rozmanité na to, aby boli správne použité v uvoľnenejších prostrediach reálneho sveta.
Komunita umelej inteligencie sa pomaly vzďaľuje od tohto prístupu v iných oblastiach, pričom metódy učenia sa pod dohľadom pre zrak [15] aj jazyk [16] získavajú značnú pozornosť a často prekonávajú tradičné metódy pod dohľadom. Nedávny pokrok v samokontrolnom učení ukázal, že modely s vlastným dozorom sú robustnejšie a prejavujú sa ako správanie, ktoré nie je počas tréningu explicitne definované.
Napríklad DINO [17], transformátor videnia trénovaný v režime s vlastným dohľadom, sa naučil funkcie špecifické pre triedu umožňujúce segmentáciu objektov bez dozoru bez použitia akýchkoľvek takýchto označení počas tréningu. Cosmaand Radoi [10] navrhol prvú kontrastnú metódu pre učenie sa pod dohľadom pre gaitanalýzu, trénovaním ST-GCN [18] na menšej verzii DenseGait [12]. Ich metóda dosiahla primerané výsledky v úlohách rozpoznávania chôdze po prúde a ukázala, že existuje silná korelácia medzi veľkosťou vopred trénovaného súboru údajov a výkonom prenosu s nulovým záberom.
Zatiaľ čo mnohé prístupy k analýze chôdze využívajú siluety extrahované z odčítania pozadia [6,8,9], extrahovanie siluet v scenároch skutočného sledovania predpokladá použitie pokročilejších techník, ako je segmentácia inštancií [19], ktoré sú spojené s vysokými výpočtovými nákladmi. Postupnosti siluet zaberajú značný úložný priestor a nie sú dostatočne flexibilné na to, aby sa dali použiť v iných priľahlých úlohách, ako je napríklad rozpoznávanie aktivít. Siluety navyše kódujú jemné náznaky vzhľadu, vďaka čomu nie je jasné, do akej miery sa pri identifikácii využíva pohyb [20].
Na druhej strane, 2D poseestimačné modely sú čoraz presnejšie a výpočtovo efektívnejšie [21,22]. Kostry sa dajú extrahovať lacno av súčasnosti sú spoľahlivejšie ako 3D siete a 3D pózy, najmä na diaľku. Navyše, 2D kostry sú podstatne ľahšie ako siluety z hľadiska dlhodobého skladovania.
Súčasné architektúry na spracovanie sekvencií kostier využívajú prirodzenú priestorovú grafovú štruktúru prítomnú v ľudskej kostre, čím sa do návrhu modelu zavádza indukčná odchýlka. Modely ako populárny ST-GCN [18] a MS-G3D [23] zaznamenali pôsobivé výsledky pre rozpoznávanie akcií na základe kostry.
Súčasne došlo k explózii v používaní modelov transformátorov takmer vo všetkých oblastiach hlbokého učenia od ich počiatočnej aplikácie na spracovanie prirodzeného jazyka.
Transformátory sa považujú za všeobecnejšiu architektúru s niekoľkými indukčnými odchýlkami. Transformátory sa spočiatku snažili prispôsobiť modelom CNN na klasifikáciu obrázkov [24], ale v súčasnosti prekonávajú iné modely a vykazujú sľubné výsledky v scenároch s vlastným dohľadom, viac ako iné typy architektúr, transformátory preukázali pôsobivú schopnosť učiť sa a nové správanie. -dozor [17].
Cosma a Radoi [12] boli prví, ktorí navrhli GaitFormer, priamu adaptáciu modelu kódovacieho transformátora videnia na rozpoznávanie chôdze, využívajúcu jednotlivé kostry ako „záplaty“ vstupu, v podstate len vykonávajúce dočasnú pozornosť, ignorujúc vzťahy s priestorovou pozornosťou.
GaitFormer bol trénovaný spôsobom s vlastným dozorom a prekonal ostatné metódy rozpoznávania chôdze aj bez akéhokoľvek dolaďovania. Takáto predchádzajúca práca je povzbudivá a pripravuje pôdu pre hlbšiu štúdiu potenciálnej aplikácie architektúr transformátorov na analýzu chôdze. Môžu byť modely transformátorov videnia prispôsobené na učenie sa reprezentácií chôdze kostry s vlastným dohľadom?
Hlavným architektonickým problémom transformátorov videnia je definovanie správnych vzťahov medzi obrazovými záplatami, ktoré definujú lokálne a globálne informácie. Pri aplikácii na chôdzu zodpovedá výber rozmerov náplasti množstvu zakódovaných časových a priestorových informácií o sekvencii kostry.
V tejto práci uvádzame rozsiahlu štúdiu piatich rôznych transformátorov videnia, prispôsobených na rozpoznávanie chôdze. Skúmame klasický ViT model [24], CaiT [25], CrossFormer [26], TwinsSVT [27] a token-to-token ViT [28].

Každá architektúra je trénovaná oddelene kontrastným spôsobom s vlastným dohľadom na dvoch rozsiahlych súboroch údajov „vo voľnej prírode“ 2D sekvencií kostry chôdze: DenseGait – automaticky zhromaždený súbor údajov z streamov rawsurveillance a GREW, menší súbor údajov, ktorý obsahuje čisté ľudské anotácie.
Skúmame možnosti prenosu cez dva riadené súbory údajov na rozpoznávanie chôdze, CASIA [6] a FVG [29]. Pre každý súbor údajov analyzujeme priamy (nulový záber) prenos a efektivitu údajov počas jemného dolaďovania tréningom s postupne väčšími podmnožinami súborov údajov. Okrem toho vykonávame ablačnú štúdiu o vzťahu medzi priestorovými a časovými rozmermi pre veľkosti náplastí pre SimpleViT a CaiT , štandardná chrbtica pre väčšinu optických transformátorov k dnešnému dňu.
Zvyšok papiera je usporiadaný nasledovne. Vykonávame prehľad súvisiacich prác na vysokej úrovni o modeloch rozpoznávania chôdze a transformátoroch videnia. Všimli sme si, že modely reprezentácie chôdze vysoko ťažia z tréningu s vlastným dohľadom, aby mali robustnejšie a všeobecnejšie zabudovanie, a modely transformátorov preukázali veľkú modelovaciu kapacitu v režimoch tréningu s vlastným dohľadom.
Ďalej matematicky popisujeme päť architektúr, ktoré porovnávame, a popisujeme predspracovanie údajov a transformácie kostry, ktoré je potrebné vykonať, takže transformátory videnia musia bez problémov fungovať na sekvenciách kostry. Opisujeme tiež rozširovanie údajov, tréningové a porovnávacie súbory údajov a experimentálne nastavenia.
Ukážeme výsledky na CASIA-B a FVG pre každú z piatich architektúr a dve množiny údajov „predtrénovania v divočine“. Nakoniec urobíme ablačnú štúdiu o vzťahu medzi priestorovými a časovými veľkosťami náplastí a poskytneme krátku diskusiu o našich výsledkoch. Náš zdrojový kód zverejňujeme na GitHub (https://github.com/cosmaadrian/gait-vit, prístupný 28. februára 2023) kvôli transparentnosti a reprodukovateľnosti.
2. Súvisiace práce
V tejto časti uvádzame stručný prehľad existujúcich metód na rozpoznávanie chôdze v kontrolovanom prostredí a „vo voľnej prírode“. Ďalej popisujeme hlavný vývoj modelov transformátorov a najmä ich aplikáciu v oblasti videnia.
2.1. Rozpoznanie chôdze
Podobne ako pri identifikácii na základe tváre, rozpoznávanie chôdze sa spolieha na metrické učenie. Na rozdiel od tradičných biometrických metód autentifikácie, ktoré sú založené na jedinom obrázku (napr. rozpoznávanie tváre) a vyžadujú si rozsiahlu spoluprácu (napr. biometrická autentifikácia založená na dúhovke), sú vlastnosti chôdze spracované ako sekvencia snímok pohybu. Takáto dynamika gest si vyžaduje väčšiu zložitosť pri určovaní najinformatívnejšej podsekvencie, ale umožňuje použitie nenápadnej autentizácie na diaľku.
V tomto kontexte úloha znamená trénovať kódovaciu sieť na mapovanie sekvencií chôdze do priestoru vkladania, kde podobnosť vkladania zodpovedá podobnosti chôdze. Vloženie prechádzok, ktoré patria tej istej osobe, by malo byť blízko priestoru na vloženie a osoby, ktoré pochádzajú z rôznych identít, musia byť vzdialenejšie. V tomto priestore vloženia možno vyvodiť závery získaním vloženia sekvencie chôdze a využitím najbližšieho suseda. prístup na databáze známych prechádzok.
Súčasné prístupy v rozpoznávaní založenom na chôdzi sú rozdelené do dvoch kategórií: na základe vzhľadu [8,9] a na základe modelu [10,12,30]. Metódy založené na vzhľade najskôr získajú siluety kráčajúcich objektov pomocou algoritmov odčítania pozadia alebo segmentácie z každého snímku videa.
Potom je sekvencia siluet privedená do architektúr založených na CNN, ktoré extrahujú priestorové a časové prvky, ktoré sú agregované do konečného vloženia na rozpoznanie. Prístupy založené na modeloch extrahujú kostry z RGB videí pomocou modelov poseestimácie [21,22]. Sekvencie kostier sú zvyčajne spracované modelmi, ktoré sa spoliehajú na konvolúcie grafov [10,30] na získanie zakotvenia chôdze.
GaitSet, práca Chao a kol. [8] považuje chôdzu za neusporiadaný súbor siluet. Autori tvrdia, že táto reprezentácia je flexibilnejšia ako sekvencia siluety, pretože je odolná voči rôznym usporiadaniam rámov alebo kombinácii viacerých smerov a variácií chôdze. Využívajú konvolučné vrstvy pre každú siluetu na získanie funkcií na úrovni obrazu a kombinujú ich do funkcie nastavenej úrovne s funkciou Set Pooling. Konečný výstup získajú použitím svojej verzie HorizontalPyramid Matching [31].
Fan a kol. [9] si všimli fakt, že špecifické časti ľudskej siluety by mali mať svoj časopriestorový výraz, keďže každá z nich má jedinečný vzor. Ich architektúra, GaitPart, využíva fokálne konvolučné vrstvy (FConv), ktoré sú špecializovaným typom konvolúcie s obmedzenejším vnímavým poľom. Autori tvrdia, že FConv pomáha ich architektúre naučiť sa viac jemnozrnných prvkov pre rôzne časti pohybujúceho sa tela. Predstavujú tiež moduly na zachytávanie mikropohybov, ktoré sa používajú na extrahovanie vlastností malých časových sekvencií.
Teepe a kol. [30] navrhujú GaitGraph, ktorý využíva adaptovanú grafovú konvolučnú sieť nazývanú ResGCN [32] na kódovanie časopriestorových znakov získaných zo sekvencie kostier. Li a spol. [33] navrhujú PTP, čo je štruktúra, ktorá agreguje viaceré časové znaky z jedného cyklu chôdze na základe ich analýzy najdôležitejších fáz chôdze.
Využívajú tiež grafovú konvolučnú sieť na extrakciu priestorových prvkov, ktorá spolupracuje s PTP. Autori predstavujú novú metódu augmentácie údajov, ktorá upravuje chôdzu tak, aby mala viac krokov v realistickejšom cykle.
Na rozdiel od predchádzajúcich diel sa však zameriavame na skúmanie výkonnosti architektúr rozpoznávania chôdze v scenároch s vlastným dohľadom. Inšpirovaní obrovským pokrokom v oblasti počítačového videnia navrhujeme prispôsobiť existujúce architektúry transformátorov videnia tak, aby fungovali na kostrových sekvenciách namiesto obrázkov a testovali ich modelovaciu kapacitu v scenároch s vlastným dohľadom. Väčšina ostatných prác [8,9,30] zameriava svoje úsilie na vývoj neurónových architektúr, ktoré dosahujú pôsobivé výsledky pri rozpoznávaní chôdze na kontrolovaných súboroch údajov.
Máme však v úmysle odstrániť potrebu vysoko nákladných manuálnych anotácií pre súbory údajov o chôdzi a preskúmať spôsoby, ako je učenie s vlastným dohľadom vhodné na analýzu chôdze.

Predchádzajúce práce v tejto oblasti [10,12] ukázali potenciál na učenie sa dobrých reprezentácií chôdze zo slabo anotovaných súborov údajov. Cosmaand Radoi [12] navrhol GaitFormer, prvú architektúru založenú na transformátoroch na spracovanie kostrových sekvencií, inšpirovanú modelom ViT [24]. Podobne ako v [12] sa pokúšame preskúmať výkon iných modelov transformátorov videnia s odlišnou priestorovou a časovou dynamikou v mechanizme spracovania záplat. V minulosti boli navrhnuté rozsiahle súbory údajov na rozpoznávanie chôdze [7,12], čo umožňuje vývoj všeobecných architektúr pre učenie sa reprezentácie.
For more information:1950477648nn@gmail.com






