
Komputer będzie rozpoznawał ludzką mowę, choćby gdy jego użytkownik nic głośno nie powie. Nowe rozwiązania mogą pomóc osobom z chorobami neurologicznymi czy z uszkodzonym aparatem mowy, a także znacznie ułatwić komunikację w miejscach szczególnie hałaśliwych lub tam, gdzie wymagana jest cisza.
Choć rozmawiamy praktycznie wszędzie, a mowa to jeden z fundamentów cywilizacji, nie każdy jest w stanie z niej korzystać. Uniemożliwiają to choroby czy urazy. Zdarzają się też sytuacje, które utrudniają korzystanie z głosu – np. w miejscach bardzo głośnych czy przeciwnie – takich, które wymagają absolutnej ciszy. Z pomocą przychodzi technologia, która różnymi metodami zaczyna umożliwiać elektronicznym urządzeniom odczytywanie słów i całych zdań, bez pomocy dźwięków.
Komputer da szansę chorym
Naukowcy z Xiamen University i innych chińskich oraz singapurskich uczelni przedstawili niedawno wyjątkowy wynalazek, który w przyszłości ma pomagać osobom niezdolnym do mówienia na głos, mimo zachowanej aktywności mięśni aparatu mowy. Przy tej przypadłości chorzy, mimo iż nie mówią, często zachowują aktywność związanych z mową mięśni.
Urządzenie przypomina tekstylny szalik i reaguje na aktywność mięśni odpowiedzialnych za mowę. W poliestrowy materiał, z którego szalik został uszyty, wpleciono przewodzącą strukturę z posrebrzanej nici. Prowadzona jest przez nią fala elektromagnetyczna silnie skupiona tuż przy powierzchni materiału. Kiedy użytkownik próbuje mówić, mięśnie krtani, okolicy podżuchwowej i żwacze, poruszając się, zmieniają lokalne adekwatności elektryczne tkanek w pobliżu szalika. To z kolei zaburza przebieg wspomnianego pola elektromagnetycznego, a zarejestrowane zmiany trafiają do sieci neuronowej, która rozszyfrowuje słowa użytkownika.
We wstępnym badaniu z udziałem dziesięciu ochotników system osiągał dokładność niemal 99% w rozpoznawaniu mowy. Jednocześnie urządzenie okazało się bardzo odporne na przypadkowy ruch użytkownika, hałas akustyczny i zakłócenia elektromagnetyczne.
„W tej pracy przedstawiliśmy przełomowe rozwiązanie w dziedzinie elektromagnetycznej komunikacji fizjologicznej – interfejs w formie szalika ISC, który w sposób niewyczuwalny rejestruje subtelną aktywność wielu mięśni, umożliwiając wyjątkowo odporne na zakłócenia dekodowanie bezgłosowej mowy” –
– piszą naukowcy.
AI może też zrozumieć emocje
Jednak mowa to nie tylko suche słowa czy zdania. To także wyraz emocji. Brytyjsko-chiński zespół kierowany przez naukowców z University of Cambridge i Beihang University pokazał, iż także ładunek emocjonalny można rozszyfrować. Naukowcy zaprezentowali zakładaną na szyję opaskę wykonaną z elastycznej dzianiny (95% poliestru i 5% spandexu), która także ma pomagać osobom z zaburzeniami aparatu mowy. Badacze mówią o obsługiwanym przez sztuczną inteligencję „inteligentnym gardle”.
Na materiał metodą sitodruku naniesiono warstwę grafenową, srebrne elektrody i warstwę izolującą. Grafen działa jako czuły czujnik odkształceń – gdy skóra i mięśnie szyi wykonują mikroruchy, zmienia się opór elektryczny grafenowej warstwy. W ten sposób rejestrowane są sygnały z okolicy szyi powstające w czasie mówienia. Z kolei sztuczna inteligencja odpowiada za dekodowanie sygnałów w czasie rzeczywistym. Naukowcy twierdzą, iż pozwala to na płynną, a ponadto ekpresyjną emocjonalnie komunikację.
Urządzenie przetestowali na razie u pięciu ochotników z zaburzeniami kontroli mięśni potrzebnych do mówienia, którzy wcześniej przeszli udar. Wynalazek inteligentnie poprawiał spójność logiczną i emocjonalną wypowiedzi u niedużej grupy testujących go pacjentów. Odsetek błędów osiągnął zaledwie 4,2% dla słów i 2,9% dla zdań, a poziom zadowolenia użytkowników wzrósł o 55%.
„W naszej pracy przedstawiamy IT – zaawansowany, zakładany na ciało system zaprojektowany z myślą o pacjentach po udarze z dyzartrią. Ma on umożliwić im komunikowanie się z płynnością, intuicyjnością i ekspresją zbliżoną do naturalnej mowy” –
– piszą naukowcy w pracy opublikowanej w piśmie „Nature Communications”.
„Choć obecne badanie obejmuje ograniczony zasób słownictwa i niewielką grupę pacjentów po udarze, a do rozpoznawania emocji wykorzystuje tylko jeden rodzaj sygnału, architektura systemu została zaprojektowana tak, aby można ją było skalować i dostosowywać do większych grup użytkowników, szerszego słownictwa oraz dodatkowych metod pomiaru” –
– dodają.
Przepływ krwi koduje mowę
Zespół z South China University of Technology wykorzystał technikę znaną jako fotopletyzmografia (PPG). To optyczna metoda mierzenia przepływu krwi w tkankach. System składa się z niewielkiego czujnika umieszczonego w naszyjniku. Sensor, z wykorzystaniem światła o kilku długościach fali rejestruje bardzo subtelne zmiany zachodzące podczas bezgłośnego poruszania mięśniami zaangażowanymi zwykle w mowę. Następnie sztuczna inteligencja analizuje te sygnały, rozpoznaje wypowiadane bezgłośnie słowa, a kolejny model przekształca je w słyszalną mowę.
Na razie w przeprowadzonych dotąd testach z udziałem 16 osób system rozpoznawał 15 bezgłośnie wypowiadanych komend. Skuteczność rozpoznawania wyniosła średnio około 81%. Na podstawie zarejestrowanych sygnałów udało się też odtworzyć zrozumiałą mowę, choć w tym przypadku poprawnie rozpoznawano jeszcze tylko ok. 61% słów.
„Wyniki te pokazują duży, wcześniej niewykorzystany potencjał odtwarzania szczegółowych cech mowy z fizjologicznych sygnałów o niskiej częstotliwości. System może zdaniem badaczy otworzyć nowe możliwości tworzenia dyskretnych i stale dostępnych interfejsów, które mogą znaleźć zastosowanie w urządzeniach ubieralnych i innych technologiach wspomagających komunikację” –
– opisują swoje badanie autorzy.
Podczerwone czujniki obserwują twarz
Nieco podobne – również optyczne – podejście wykorzystali eksperci z Ritsumeikan University. Zaproponowali oni system bezgłośnego sterowania elektronicznymi urządzeniami dzięki inteligentnych okularów wyposażonych w czujniki podczerwieni. Czujniki nie rejestrują jednak przepływu krwi, a drobne ruchy skóry policzków, żuchwy i okolic stawu skroniowo-żuchwowego, podczas bezgłośnego wypowiadania komend, a algorytmy uczenia maszynowego rozpoznają na tej podstawie słowa.
W testach system połączony jeszcze z dodatkowymi czujnikami przy uszach bardzo dobrze radził sobie z niewielkim zestawem poleceń – pięć prostych komend rozpoznawał z wysoką skutecznością, a gdy liczba poleceń wzrosła do 21, poprawnie rozpoznawał około 76% prób. Wyniki pogarszały się jeszcze podczas chodzenia i po ponownym założeniu urządzenia, co pokazuje, iż prototyp jest obiecujący, choć przez cały czas wrażliwy na warunki użytkowania. Naukowcy dodają, iż ich wynalazek może m.in. znaleźć zastosowanie jako element coraz popularniejszych inteligentnych okularów.

Kamery rejestrują mięśnie
Kamery można też wykorzystać do analizy ruchu związanych z mową mięśni. Tak zrobili badacze z południowokoreańskiego POSTECH, którzy opracowali miękki czujnik zakładany na szyję. dzięki miniaturowej kamery śledzi on bardzo drobne ruchy skóry i mięśni towarzyszące bezgłośnemu mówieniu. Sztuczna inteligencja analizuje te wzorce, rozpoznaje określone słowa, a następnie syntezator odtwarza je jako słyszalną mowę dopasowaną do głosu użytkownika. Autorzy widzą jego zastosowanie przede wszystkim jako pomoc dla osób, które utraciły głos, np. wskutek chorób strun głosowych lub operacji krtani. Technologia mogłaby także służyć do komunikacji w bardzo hałaśliwych miejscach, takich jak fabryki, a choćby do bezgłośnego porozumiewania się tam, gdzie mówienie na głos byłoby niewygodne.

Radarowy system działa z daleka
Z jeszcze innej technologii skorzystali eksperci z Nanjing University. Stworzone przez nich urządzenie mSilent wykorzystuje radar fal milimetrowych, który bezdotykowo wychwytuje bardzo drobne ruchy twarzy i aparatu mowy podczas bezgłośnego wypowiadania słów. Następnie algorytmy przetwarzają te sygnały i sieć neuronowa rozpoznaje, co użytkownik „powiedział” bez wydawania dźwięku.
Urządzenie przetestowano na zbiorze tysiąca zdań używanych w codziennych rozmowach. Co więcej, może działać z dystansu. Z odległości 1,5 m system osiągał średni współczynnik błędnie rozpoznanych słów na poziomie 9,5%. Badacze sprawdzili już swój wynalazek w praktycznych zastosowaniach. W jednym z eksperymentów wprowadzali tekst do komputera, a w drugim obsługiwali asystenta samochodowego. W obu przypadkach średni odsetek błędów w rozpoznawaniu słów wynosił mniej niż 6%.
Wiele wskazuje więc na to, iż komputery i inne urządzenia zrozumieją nas bez głosu. W pierwszej kolejności skorzystać mogą osoby ze zdolnością mówienia uszkodzoną przez chorobę czy wypadek. Jednocześnie, zamiast w zatłoczonym autobusie czy kolejce w sklepie pisać na telefonie wiadomości, może będziemy mówili do telefonu, ale nikt z otoczenia nas nie usłyszy. W podobny sposób będziemy mogli podyktować komendy systemom w samochodzie, albo łatwo i gwałtownie podyktować e-mail, nie przeszkadzając kolegom i koleżankom z biura.

Źródło zdjęcia: Steve A Johnson/Unsplash





