Nové, časovo-priestorové nepretržité rozpoznávanie posunkovej reči pomocou pozornej siete s viacerými funkciami(1)
Jun 01, 2023
Abstraktné: Vzhľadom na toky videa sa snažíme správne odhaliť nesegmentované znaky súvisiace s nepretržitým rozpoznávaním posunkovej reči (CSLR). Napriek nárastu navrhovaných metód hlbokého učenia v tejto oblasti sa väčšina z nich zameriava hlavne na používanie iba funkcie RGB, či už ide o full-frame obraz alebo detaily rúk a tváre. Nedostatok informácií pre tréningový proces CSLR výrazne obmedzuje schopnosť naučiť sa viacero funkcií pomocou vstupných video snímok. Navyše, využitie všetkých snímok vo videu pre úlohu CSLR by mohlo viesť k suboptimálnemu výkonu, pretože každá snímka obsahuje inú úroveň informácií vrátane hlavných funkcií pri vyvodzovaní šumu. Preto navrhujeme nové priestorové nepretržité rozpoznávanie posunkovej reči pomocou pozornej siete s viacerými funkciami na zlepšenie CSLR poskytovaním ďalších kľúčových bodov. Okrem toho využívame vrstvu pozornosti v priestorových a časových moduloch na súčasné zdôraznenie viacerých dôležitých funkcií. Experimentálne výsledky z oboch súborov údajov CSLR ukazujú, že navrhovaná metóda dosahuje lepší výkon v porovnaní so súčasnými najmodernejšími metódami o 0,76 a 20,56 pre skóre WER na súboroch údajov CSL a PHOENIX.

Superman bylinky cistanche
Kľúčové slová: súvislý posunkový jazyk; priestorový; časový; multi-funkcie; Kľúčové body; sebapozornosť
1. Úvod
Posunkový jazyk uprednostňuje manuálnu komunikáciu pomocou gest rúk, reči tela a pohybov pier namiesto zvuku [1,2]. Posunkový jazyk zvyčajne používajú ľudia, ktorí sú nepočujúci alebo nedoslýchaví, ale môžu ho použiť aj v situáciách, keď je nemožné alebo ťažké počuť zvuky. Preto je potrebný systém rozpoznávania posunkovej reči (SLR), pretože pomáha spájať ľudí, ktorí nepočujú, a tých, ktorí nepočujú.
V posledných rokoch výskumníci sústredili veľkú pozornosť na zrkadlovky kvôli bohatým vizuálnym informáciám, ktoré poskytujú. Nedávne štúdie SLR sú zvyčajne zoskupené do izolovaného rozpoznávania posunkového jazyka (ISLR) alebo nepretržitého rozpoznávania posunkového jazyka (CSLR). Niekoľko prác sa venuje iba ISLR [3,4], zatiaľ čo iné analyzujú len jednoduchšie úlohy, ako sú statické gestá na rozpoznávanie abecedy [5]. Medzitým sú najnovšie metódy zvyčajne komplikovanejšie, pretože riešia úlohy CSLR [6–8]. V porovnaní s ISLR je CSLR náročnejším problémom, pretože zahŕňa rekonštrukciu viet.

Čaj Cistanche
Kliknutím sem zobrazíte čajové produkty Cistanche deserticola
【Požiadať o viac】 E-mail:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Výskum CSLR je stále veľmi žiadaný, pretože jeho realizácia úzko súvisí s každodennými podmienkami v reálnom svete. Tento prístup má za cieľ rozpoznať sériu glos, ktoré sa vyskytujú vo video sérii bez jasnej segmentácie alebo dokonca žiadnej. Okrem toho zahŕňa veľké množstvo výskumu strojového učenia a dôkladné pochopenie ľudského správania. Zahŕňa napríklad sledovanie ľudského pohybu [9], rozpoznávanie gest [10] a rozpoznávanie tváre [11]. Napriek tomu existuje niekoľko problémov pri plnení úloh CSLR.
Po prvé, zber údajov a anotácia sú pre CSLR drahé [12]. Toto je možno jedna z výziev, ktorým čelí pri jeho vývoji, pretože CSLR je zapojený do veľkej siete a množstvo údajov silne ovplyvňuje výkon [13]. Okrem toho je niekoľko dostupných súborov údajov o posunkovej reči slabo anotovaných [12,14,15]. Na vyriešenie tohto problému mnohé štúdie použili slabo kontrolovaný prístup spolu s aplikáciou modulu na zarovnanie a extrakciu funkcií na architektúru siete [12].
Po druhé, v porovnaní s ISLR je CSLR komplikovanejší. Dostatok informácií sa získava využívaním viacerých funkcií; Ukázalo sa, že to dosahuje lepší výkon ako pri použití jednej funkcie, ako sa uvádza v predchádzajúcich prácach [16–18]. Tieto viaceré funkcie pozostávajú z hlavnej funkcie, ktorou je obraz tela, ktorý dosahuje najvyššiu presnosť, a ďalšie funkcie, ako je pozícia, hlava, ľavá ruka a pravá ruka, ktorá má nižšiu presnosť pre individuálny výkon [17,18]. Trénovanie veľkej siete s veľkým množstvom dát je časovo náročné [13]. Pridanie vstupného toku tiež zvyšuje čas školenia, zatiaľ čo používanie ďalších funkcií založených na obrázkoch zvyšuje náklady [19]. Preto si musíme vybrať dôležité vlastnosti, aby sme mohli trénovať efektívne.

Čínska bylina cistanche
Po tretie, video vstup má veľký počet obrázkov v sekvencii. Niektoré obrázky majú v dôsledku rýchleho pohybu nejasný tvar ruky, čo môže viesť k nesprávnym informáciám. Preto náš navrhovaný model využíva sebapozornosť na základe [20] na pomoc pri výbere dôležitých informácií. Navyše, sebapozornosť dokázaná [21,22] má vplyv na zvýšenie výkonnosti.
Preto navrhujeme nový model nazývaný nová časopriestorová pozorná multifunkcia (STAMF), ktorý zvládne všetky problémy. Nadviazali sme na predchádzajúce práce [17,23], u ktorých sa preukázalo, že fungujú pre CSLR so slabými problémami s anotáciou. Konštruujú model pomocou troch hlavných komponentov: prvým je priestorový modul, druhým je časový modul a tretím je modul sekvenčného učenia. Navrhujeme efektívny a efektívny vstup viacerých funkcií pomocou funkcie full frame spolu s funkciami kľúčových bodov na vykonávanie úloh CSLR. Funkcia full-frame predstavuje obrázok tela ako hlavný prvok a kľúčové prvky ako doplnkovú funkciu. Kľúčovým bodovým znakom je póza tela vrátane detailu pózy ruky. Táto poloha tela je najefektívnejšou doplnkovou funkciou, pretože v niektorých dielach sa preukázalo, že dosahuje najvyššiu presnosť po funkcii full-frame [17,18]. Používame tiež modul pozornosti, ktorý využíva samoupozorňovanie na základe [20] na zachytenie dôležitej funkcie a na pomoc pri sekvenčnom učení zvýšiť výkon.
Prínos tohto rukopisu je zhrnutý takto: • Zavádzame novú časovú pozornosť do sekvenčného modulu, aby sme zachytili dôležité časové body, ktoré prispievajú ku konečnému výstupu; • Predstavujeme multifunkciu, ktorá pozostáva z funkcie full-frame z hodnoty RGB snímky ako hlavnej funkcie a kľúčových bodov, ktoré zahŕňajú pózu tela s detailom tvaru ruky ako ďalšiu funkciu na zlepšenie výkonu rozpoznávania modelu; • Používame metriku WER, aby sme ukázali, že náš navrhovaný model STAMF prevyšuje najmodernejšie modely na oboch porovnávacích súboroch údajov CSLR prostredníctvom experimentov.

Doplnok Cistanche v mojej blízkosti - Zlepšenie pamäte
2. Súvisiace práce
V technológii došlo k niekoľkým pokrokom a na zrkadlovkách sa urobilo veľa výskumov. Predchádzajúce štúdie [24–27] skúmali možnosť použitia ISLR, ktorý má segmentáciu pre každé slovo. V posledných rokoch sa na extrakciu prvkov pomocou konvolučných sietí, buď 2D [28,29] alebo 3D [30,31], pre ich silnú vizuálnu reprezentáciu použili metódy založené na hlbokom učení. Väčšina skorého výskumu rozpoznávania posunkovej reči sa sústredila na ISLR s multimodálnymi charakteristikami [30–32], ako sú RGB, hĺbkové mapy a kostry, ktoré poskytujú lepší výkon.
V súčasnosti sa CSLR stala populárnejšou, hoci nebola jasne rozdelená medzi jednotlivé slová. Prvé práce používajú extraktor funkcií CNN [6,33] a HMM [34] na vytvorenie cieľa sekvencie. Niektoré nedávne výskumy systémov CSLR [17,23] zahŕňali tri hlavné kroky pri plnení úlohy rozpoznávania problémov. Najprv vykonali extrakciu priestorových prvkov, potom časovú segmentáciu a nakoniec syntézu viet s jazykovým modelom [35] alebo použili sekvenčné učenie [17,23]. Toto sekvenčné učenie využívalo Bi-LSTM a CTC na nájdenie vzťahu medzi leskom znakov vo video sekvenciách. Aj keď používa slabú anotáciu, ktorá má nesegmentované videosekvencie na definovanie glosy znakov, tieto prístupy ukázali sľubné výsledky.
Najnovšia súvisiaca štúdia CLSR, ktorá implementovala prístup založený na viacerých funkciách [17], však používala súčasne päť funkcií. Prístup s viacerými funkciami je ťažší v porovnaní s použitím menšieho počtu funkcií [19]. Tento prístup tiež nedokáže zvládnuť zašumené snímky z videosekvencie, ktoré majú nejasné informácie, ako je napríklad rozmazaný tvar ruky v dôsledku rýchleho pohybu. Navyše, spoliehanie sa na sekvenčné učenie založené na RNN môže naraziť na problémy s dlhými sekvenciami a môže stratiť globálny kontext [20].

Doplnok Cistanche v mojej blízkosti - Zlepšenie pamäte
Súčasný výskum sa zameriava na zlepšenie výkonu pridaním mechanizmu sebapozorovania [21,22], ktorý dokáže zvládnuť dlhšie sekvencie, aby sa naučil globálny kontext. Sebapozornosť je založená na ranom výskume [20], ktorý ukázal, že sebapozornosť má tú výhodu, že dokáže zvládnuť dlhé závislosti. Táto sebapozornosť sa však ľahšie naučí kratšou cestou v porovnaní s dlhšou cestou s dlhými závislosťami. V predchádzajúcich prácach CLSR [21,22] mohla sebapozornosť pomôcť sieti naučiť sa túto funkciu efektívnejšie.
Preto v tomto článku predstavujeme nový časopriestorový pozorný viacfunkčný model. Tento navrhovaný model efektívne extrahuje dôležité funkcie a lepšie sa naučí sekvenciu poskytovaním dôležitých informácií pomocou mechanizmu sebapozorovania z viacerých funkcií. Všetky procesy sú vykonávané end-to-end prístupom.
3. Navrhovaná metóda
Táto časť podrobne popisuje základné techniky nášho navrhovaného modelu pre CSLR. Preto začneme túto časť vysvetlením prehľadu nášho navrhovaného modelu. Okrem toho poskytujeme ďalšie podrobnosti o každom kľúčovom komponente, vrátane priestorového modulu, časového modulu a modulu učenia sekvencií. Okrem toho tiež vysvetľujeme náš navrhovaný modul pozornosti, aby sme pomohli modelu lepšie sa učiť. Nakoniec môžeme integrovať rámec pre školenie a odvodzovanie do nášho navrhovaného modelu.
3.1. Rámcový prehľad
Na základe video vstupu je cieľom nášho navrhovaného modelu predpovedať zodpovedajúce znamienko do správnej vety lesku. Prvý modul generuje viacero priestorových prvkov, ako sú celosnímkové a kľúčové body pre každú T snímku videa. Potom nám časový modul umožňuje extrahovať časové korelácie priestorových prvkov medzi snímkami pre oba prúdy. Ako posledný krok boli priestorové a časové siete prepojené s obojsmernou dlhodobou krátkodobou pamäťou (Bi-LSTM) a CTC pre sekvenčné učenie a odvodzovanie. Ďalej vysvetlíme naše hlavné komponenty podrobnejšie a postupne. Prehľad nami navrhovanej architektúry je znázornený na obrázku 1.

Obrázok 1. Celková architektúra navrhovanej metódy pozostáva z troch komponentov: priestorového modulu, časového modulu a modulu sekvenčného učenia. Priestorový modul najprv vezme sekvenciu obrázkov na extrahovanie prvkov po snímkach a potom použije časový modul na extrahovanie dočasných prvkov. Potom sa časové znaky odošlú do modulu učenia sekvencií, aby vykonal predikciu slova a vytvoril ho do vety
3.2. Priestorový modul
Priestorový modul využíva full-frame funkcie a kľúčové body, ako je znázornené na obrázku 2. Tento modul využíva 2D-CNN sieťovú architektúru ako chrbticu a ResNet50 je vybraný na zachytenie viacerých funkcií. ResNet50 je efektívnejší na použitie v porovnaní s nedávnou architektúrou ResNet z hľadiska času, pričom má porovnateľný výsledok [36,37]. RGB používa ResNet50 priamo, zatiaľ čo kľúčový bod získava HRNet [38] z video rámca a je extrahovaný pomocou ResNet50 na získanie funkcií kľúčového bodu.

Obrázok 2. Architektúra priestorového modulu využíva viacprúdový vstup. RGB stream ako funkcia full-frame a stream kľúčových bodov ako funkcia kľúčových bodov.
3.2.1. Funkcia Full-Frame
Použili sme naše kroky predspracovania na údaje RGB a potom sme naše údaje vložili do modelu. Potom sme ich vložili ako full-frame vstup do našej architektúry. Obrázok 3 zobrazuje pôvodný obrázok RGB na ľavej strane a orezaný obrázok na pravej strane. Orezaný obrázok sa použije ako vstup modelu. Toto ilustruje krok predbežného spracovania, ktorý redukuje menej dôležité časti obrazu a viac sa zameriava na podpisovateľa. Toto orezanie používa metódu náhodného orezania z [12] na rozšírenie množiny údajov. Funkcia fullframe je extrahovaná z orezaného obrázka pre každú snímku v sekvencii pomocou ResNet50.

Obrázok 3. Funkcia celej snímky s obrázkom RGB, (ľavý obrázok) je pôvodný obrázok a (pravý obrázok) je orezaný obrázok na prispôsobenie navrhovanému modelu
3.2.2. Vlastnosti kľúčových bodov
Extrahovali sme kľúčové body v priestorovom module z údajov RGB pre každú snímku vo video vstupe. Kvalita kľúčových bodov má dôležitú úlohu v našom navrhovanom modeli, takže musíme použiť robustný prístup, ako je HRNet [38]. Na odhad všetkých 133 kľúčových bodov tela sme použili vopred trénovaný HRNet [38] a z jeho výsledku sme použili 27 zo 133 kľúčových bodov. Ako je znázornené na obrázku 4, ľavá strana je pôvodný kľúčový bod hornej časti tela a pravá strana je vybratých 27 kľúčových bodov hornej časti tela. Medzi týchto 27 kľúčových bodov patria zápästia, lakte, ramená, krk, ruky a prsty.

Obrázok 4. Vlastnosti kľúčových bodov súboru údajov PHOENIX-RWTH [33,39], (ľavý obrázok) extrakcia z RGB obrázku a (pravý obrázok) je vybraný kľúčový bod používaný navrhovaným modelom.
3.3. Dočasný modul
Časový modul má za cieľ naučiť sa časopriestorové informácie z priestorového modulu. Dočasné moduly sú konštruované naskladaním dočasného združovania pre každý prúd. Ako je znázornené na obrázku 5, modul dočasného združovania pozostáva z dočasnej konvolučnej vrstvy a združovacej vrstvy na extrahovanie funkcií zo sekvenčných vstupov.

Obrázok 5. Architektúra dočasného modulu pozostáva z naskladaného 1D-CNN a združovacej vrstvy, v ktorej je zabudovaný modul pozornosti. Pracujte paralelne pre oba prúdy prvkov zreťazené na konci naskladaných vrstiev a vytvorte jeden dočasný prvok so štyrikrát menšou dĺžkou sekvencie.
Vstupom je zoznam priestorových multifunkcií z predchádzajúcej fázy. Časový znak sa získa pomocou časovej konvolučnej vrstvy, ktorá je jedinou 1D konvolučnou vrstvou s rovnakými vstupnými a výstupnými dĺžkami, po ktorej nasleduje jedna združovacia vrstva, ktorá zmenšuje veľkosť na polovicu. Podľa predchádzajúcich prác [12] je najlepšou konfiguráciou použitie týchto dvoch na sebe naskladaných vrstiev dočasného združovania. Po každom dočasnom združení vložíme modul pozornosti, ktorý bude podrobne vysvetlený v časti 3.4. Nakoniec zreťazíme výstup dočasného združovania z oboch prúdov.
3.4. Modul pozornosti
Video má viacero snímok, pričom niektoré časti obrazu sú niekedy rozmazané. Súbor údajov RTWH-PHOENIX [33,39] má viac chybných rámcov ako súbor údajov CSL [8,40,41]. Stáva sa to, keď je pohyb príliš rýchly, čím sa vytvára rozmazaný obraz a výsledkom je nesprávne umiestnenie kľúčového bodu. Tento rámec sa považuje za chybný a potenciálne vedie k nesprávnej interpretácii funkcií RGB aj kľúčových bodov. Obrázok 6 zobrazuje chybné snímky v súbore údajov RTWH-PHOENIX [33]. Aby sme sa s týmto problémom vysporiadali, pridali sme vrstvu pozornosti.

Obrázok 6. Ilustrácia rámcov defektov na súbore údajov RWTH-PHOENIX [33,39]. Niektoré kľúčové body v oblasti ruky sú v nesprávnej polohe v dôsledku rozmazaných obrázkov.
Pomocou algoritmu CTC sa zarovnanie cesty spolu s jej označením vykoná pomocou prázdneho štítku a odstránením opakovaných štítkov. CTC uprednostňuje predpovedanie prázdnych štítkov pred hranicami lesku, keď nedokáže rozlíšiť hranicu lesku, ale žiadny z výsledkov nie je presvedčivý. To vedie sieť k tomu, aby využívala CTC na vytváranie špičiek vo výsledkoch pri analýze, učení a predpovedaní [42,43]. Vo všeobecnosti strata CTC hľadá kľúčové snímky a posledným výsledkom je predpoveď konkrétnej kľúčovej snímky, ktorá má vysokú pravdepodobnosť, že bude prázdnym štítkom alebo neprázdnym štítkom. Ak lesk predpovedá rovnaký štítok alebo prázdny štítok za sebou, výsledkom je rovnaký výstup. Ak sa však medzi tým istým štítkom nachádza vložený štítok, aj keď je tam len jedna chyba, vedie to k oveľa väčšej strate. Tu pridanie vrstvy pozornosti pomáha vybrať dôležitú časovú postupnosť predtým, ako sa použije na sekvenčné učenie.
Modul pozornosti využíva viachlavový mechanizmus samoupozornenia [20]. Viachlavový modul sa používa na spustenie niekoľkých paralelných mechanizmov pozornosti súčasne. Pozornosť viacerých hláv prebieha nezávisle a zameriava sa na krátkodobé závislosti alebo dlhodobé závislosti v samostatnej hlave. Každý výstup je potom lineárne zreťazený a transformovaný do požadovaného tvaru.
Súčasne sa viachlavový mechanizmus sebapozorovania stará o informácie z viacerých reprezentačných podpriestorov v závislosti od histórie pozorovaní. Pre jednoduchosť označíme vstupné sekvencie ako X. Matematicky, pre model pozornosti s jednou hlavou, daný vstup X t − T plus 1:t=[X t − T plus 1, · · ·, X t ] ∈ RT × N × P sa získajú tri podpriestory, menovite dopytovací podpriestor Q ∈ RN × dq, kľúčový podpriestor K ∈ RN × dk a hodnotový podpriestor V ∈ RN × dv. Proces učenia latentného podpriestoru možno formulovať ako [20]:
Q=XWQ, K=XWK , V=XWV,
Potom sa škálovaná bodová pozornosť produktu použije na výpočet výstupu pozornosti ako [20]:
Pozor(Q, K, V)=tak f tmaxQKT/ p dkV,
Okrem toho, ak máme viacero hláv, ktoré súbežne sledujú viaceré reprezentácie vstupu, môžeme súčasne získať relevantnejšie výsledky. Posledným krokom je zreťaziť všetky hlavy a znova ich premietnuť, aby sa vypočítalo konečné skóre [20]:
MultiHead(Q,K,V)=Concat(head1,... , hláv )WO,
hlava=Pozor (Qi,Ki,Vi),
kde Qi=XWQ i, Ki=XWVi a model WO ∈ R hd × d. Nakoniec môže vybrať dôležitú časť zo sekvencie funkcií, pretože nie všetky informácie v sekvencii sú dôležité.
Ako je znázornené na obrázku 7, modul pozornosti používame v niekoľkých konfiguráciách. Prvý modul pozornosti je umiestnený na konci priestorového modulu, zatiaľ čo druhý a tretí modul pozornosti sú umiestnené v časovom module. Druhý modul pozornosti nazývaný skorý časový modul je umiestnený za prvým blokom dočasného zoskupovania ako vstup, zatiaľ čo tretí modul časovej pozornosti, nazývaný modul neskorej časovej pozornosti, je umiestnený za druhým blokom časového zoskupovania.

Obrázok 7. Moduly pozornosti sú vložené do priestorových a časových modulov v rôznych konfiguráciách.






