Звуковата вълна на човешката реч не съдържа физически паузи между думите. На аудиограмата разговорната фраза изглежда като непрекъснат сигнал с променяща се амплитуда и честота. Паузите в естествената реч възникват за вдишване или за смислово разделяне на изреченията, но в рамките на отделните фрази думите преминават една в друга без никакви акустични празнини.
За да разбира речта, мозъкът трябва непрекъснато да решава задачата за сегментация — да разделя непрекъснатия звуков поток на отделни думи. Възрастният човек прави това автоматично, но физиологичните и математическите механизми на този процес дълго време оставаха предмет на спорове сред лингвистите и невробиолозите.
Основната трудност при сегментацията е свързана с физическите свойства на звуците. Гласните звуци са акустично по-забележими от съгласните: те са по-силни, траят по-дълго и съдържат значително повече звукова енергия. Гласните се образуват чрез свободното преминаване на въздуха през гласовите струни и отворената уста, което създава силен резонанс. Съгласните звуци, напротив, възникват при затваряне или сближаване на речевите органи (устни, език, зъби). Те са по-тихи, по-къси и често се състоят от бързи шумове или резки щраквания.
Пристрастието към съгласнитеБи било логично да се предположи, че мозъкът на слушателя трябва да се ориентира към най-силните и физически забележими елементи на потока — към гласните. Точно така постъпват бебетата през първите месеци от живота си, както и маймуните: при анализа на звуците те се опират на гласните. Само че още към края на първата година от живота си човек напълно преструктурира възприятието си. Възрастният мозък започва да използва съгласните звуци като основни ориентири за определяне на границите на думите. В науката това явление се нарича „пристрастие към съгласните“ (consonant bias).
Дълго време се смяташе, че това пристрастие е чисто човешка черта, която възниква едва с усвояването на езика, граматиката и лексиката. Предполагаше се, че без вътрешни езикови познания мозъкът не е способен да пренебрегне физическата сила на гласните в полза на информативността на съгласните.
Куче по време на ЕЕГ експеримент, свободна интерпретация
Изследователска група от Университета „Лоранд Етвеш“ (ELTE) в Будапеща доказа, че това схващане е погрешно. В статия, публикувана в списание Science, учените демонстрираха, че домашните кучета (Canis familiaris) при анализа на непозната човешка реч проявяват точно същото предпочитание към съгласните, както и хората. За да определят границите на думите по съгласните звуци, на животното не е необходимо да владее речта — достатъчен е самият факт, че то редовно се намира в речева среда.
Защо точно кучетата станаха обект на изследванетоЗа да проверят същността на речевата сегментация, учените се нуждаеха от животно, което постоянно чува човешка реч, но в същото време самото то не притежава способността да говори и не използва синтаксис. Лабораторните животни (плъхове или маймуни, живеещи в клетки) не бяха подходящи за тази цел: техният слухов опит е изолиран от естествения човешки език.
Домашните кучета се оказаха оптимален модел по три причини. Първо, те живеят в човешки семейства и ежедневно чуват човешка реч в най-различни контексти. На второ място, предишни поведенчески и томографски експерименти вече са доказали, че кучетата разпознават отделни думи, различават интонациите и са способни да извличат прости статистически закономерности от звуците. На трето място, при кучетата съществува естествена разлика в житейския им опит: едни попадат при хората като кученца, а други прекарват първите месеци или години от живота си на улицата или в приюти, където контактът с речта е сведен до минимум. Това даде възможност да се провери дали работата на слуховия анализатор зависи от възрастта, на която животното е започнало да чува човешки разговори.
Изследването установи, че мозъкът на кучетата може да разделя речта на думи
Механика на експеримента: изкуствен език без подсказки
За да се изключи влиянието на познати думи, интонации и контекст, авторите на изследването създадоха изкуствен речеви поток. Той се състоеше от безсмислени трисрични псевдодуми (например „бенико“, „мозите“, „пуфуга“).
Всички звуци бяха синтезирани от компютър със строги физически параметри:
продължителността на всеки отделен звук (фонема) беше точно 125 ms; продължителността на всяка сричка беше 250 ms, което определяше сричков ритъм от 4 Hz (четири срички в секунда); продължителността на всяка псевдодума от три срички беше 750 ms, което съответстваше на честота от 1,33 Hz (една дума на всеки 0,75 s).В генерираната аудиопоредица напълно липсваха обичайните речеви ориентири.
Думите не се отличаваха с паузи, ударения, промяна във височината на тона или колебания в силата на звука. Гласните звуци във всички условия оставаха по-силни от съгласните и носеха основната част от звуковата енергия. Границите на думите можеха да се разпознаят само по един начин, чрез изчисляване на математическата закономерност, с която звуците се редяха един след друг.
Изследователите съставиха три варианта на звуковия потокПоток със структура, основана на съгласните. При това условие думите се обединяваха в устойчиви тройки от съгласни звуци (например веригите б_н_к_, м_з_т_, п_ф_г_). Гласните в тези думи се променяха непрекъснато. Слушателят можеше да определи границите на думите само ако проследяваше повторението на съгласните.
Поток със структура, основана на гласните. Тук закономерността се градеше върху гласните звуци (например, веригите _е_у_а, _о_е_у), а съгласните между тях постоянно се заместваха с нови.
Случаен поток (контрол). Същите срички се възпроизвеждаха в напълно хаотичен ред, при който нямаше никакви постоянни думи или закономерности.
Схема на стимулите в експеримента. В горната част е показано устройство за изкуствена реч: три потока от срички без паузи, обединени чрез скрити закономерности в съгласните и гласните или съставени произволно. Графиките в долната част показват акустичния профил: гласните звуци носят основната звукова енергия и са по-силни от съгласните при всички условия
Как е измервана реакцията на мозъка
В проучването са участвали 20 възрастни хора и 20 възрастни домашни кучета от различни породи. Основният метод е бил неинвазивната електроенцефалография (ЕЕГ). На главите на участниците са поставени електроди, които регистрират общата електрическа активност на невроните в кората. За да бъде сравнението коректно, учените анализираха показанията на три електрода, разположени по средната линия на черепа в анатомично сходни зони на мозъка при човека и кучето.
За обработката на ЕЕГ сигналите авторите използваха два независими инструмента:
Междуопитна кохерентност (Intertrial Coherence, ITC). Този параметър измерва фазовата синхронизация на мозъчните вълни: доколко еднакво се активират невроните в кората в отговор на ритмично повтарящ се стимул. Ако мозъкът не разбира структурата и възприема хаос, невроните се освобождават несинхронно, а кохерентността е близка до нула. Ако мозъкът успешно групира три срички в една дума, в електрическата активност се появява стабилен пик с честотата на думите, тоест 1,33 Hz. Събитиево-свързани потенциали (Event-Related Potentials, ERP). Това е анализ на амплитудата на електрическия отговор на мозъка в строго зададени времеви интервали след началото на стимула. Изследователите се съсредоточиха върху интервала от 350 до 550 ms след появата на първия звук от думата. В неврофизиологията този диапазон се свързва с компонента N400, показател, че мозъкът е идентифицирал смислова или структурна речева единица.
Начинът, по който кучетата ни слушат, може да е по-впечатляващ, отколкото сме предполагали
Резултатите от измерванията: селективност на слуха при кучетата
Данните от измерванията показват, че човешкият мозък и мозъкът на кучето обработват тези стимули по принцип по сходен начин, но с важна разлика в дълбочината на възприятието.
При хората синхронизацията на невроните на честотата на думите (1,33 Hz) възниква при слушане и на двата структурирани потока. Човешкият мозък успява да открие границите на думите както по гласните, така и по съгласните звуци. Реакцията към потока с постоянни съгласни само че се оказа значително по-силна. Това потвърди, че възрастният човек винаги дава приоритет на съгласните, дори ако може да разбере закономерността и по гласните.
При кучетата се прояви крайна форма на тази селективност:
В потока с постоянни съгласни мозъкът на кучетата да показва ясна и силна синхронизация при честотата на думите 1,33 Hz (p < 0,001). Животните уверено обединяваха сричките в думи, когато ориентир бяха съгласните. В поток с постоянни гласни синхронизацията напълно липсваше. Показателите за мозъчната активност на кучетата в този тест не се различаваха по нищо от реакцията към напълно случаен, хаотичен набор от срички (p = 0,238).Анализът на ERP потенциалите потвърди този резултат: в прозореца от 450 до 550 ms електрическият отговор на мозъка на кучетата беше ясно изразен за думи, съставени от постоянни съгласни, и напълно липсваше за думи, съставени от гласни.
Кучешкият мозък се оказа напълно нечувствителен към закономерностите, основани на гласните звуци, но мигновено изчислява скритите правила, зададени от съгласните.
Невронната синхронизация на мозъка при хората и кучетата. На спектралните графики ясно се вижда изразен пик на честотата на думите (1,33 Hz) при прослушване на поток с фиксирани съгласни (червената линия). При кучетата реакцията към думи, съставени от гласни (жълтата линия), напълно съвпада с реакцията към хаотичен шум (синята линия).
Физиката на звука и историята на опитомяването
Защо мозъкът на бозайник, който не може да говори, предпочита тихите съгласни звуци? Отговорът се крие в областта на теорията на информацията и еволюционната история на кучевите.
От гледна точка на предаването на информация съгласните звуци са много по-функционални от гласните. Препятствията, които речевият тракт създава по пътя на въздуха при произношението на съгласните, формират резки промени в спектъра. Тези промени служат като ясни маркери, посочващи смяната на един елемент от съобщението с друг. Гласните звуци, поради широкия и плавен резонанс, лесно се смесват с фоновия шум на околната среда, затихват при отдалечаване от говорещия и се изкривяват силно в зависимост от акустиката на помещението. Опирането на съгласните позволява на слуховата система да игнорира физическата нестабилност на гласните и да извлича стабилна последователност от данни.
Когато кучетата чуват стопаните си да говорят, те обръщат внимание на съгласните в думите, а не на гласните
Освен това важна роля е изиграла самата история на опитомяването на кучето. Дивите родственици на кучетата, вълците, в естествената среда използват предимно хармонични, гласоподобни звуци с изразена тоналност: вой, скимтене, ръмжене. Тези сигнали са оптимизирани за предаване на големи разстояния в гората или степта, но имат ниска информационна плътност.
В хода на съвместната еволюция с човека акустичният репертоар на кучето се е промени драстично. Основната форма на вокализация става лаят, силен, кратък, широколентов шумов сигнал с рязко начало. По своята физическа структура куческото лаене е много по-близо до съгласните звуци в човешката реч, отколкото до виенето на предците им. Постоянният живот редом с човека и селекцията за разбиране на сигналите са довели до това, че слуховата система на кучето се е приспособила към извличането на най-информативните акустични маркери от човешкия разговор.
Значението за когнитивните наукиРезултатите от изследването променят представите за фундаменталните механизми на езика. Дълго време лингвистите смятаха, че изместването на възприятието в полза на съгласните звуци е резултат от специализирани езикови модули в мозъка, достъпни само за разумния човек.
Най-добрият слушател на човека? Мозъкът на кучетата разчленява речта по начин, подобен на този при хората
Експериментът с кучета показа, че първичната обработка на речта се основава на по-древни и универсални механизми на статистическо обучение. На мозъка не е необходимо да знае значението на думите, да владее абстрактни категории и да разбира граматиката, за да разпредели входящите звуци според степента на тяхната информационна значимост. Под въздействието на външната звукова среда невронните мрежи са способни самостоятелно да се настройват за изчисляване на вероятности и да откриват границите на дискретни смислови отрязъци.
Това се потвърждава и от изследванията на съвременните големи езикови модели (LLM): изкуствените невронни мрежи, обучавайки се на терабайти текстове, също развиват вътрешно предпочитание към съгласните звуци при сегментирането на фонетичните потоци, без да притежават биологично тяло или езиково съзнание.
Кучето възприема човешката реч не като хаотична емоционална мелодия. Слуховата му кора извършва непрекъснат анализ на звуковите честоти, отхвърляйки силните гласни звуци и използвайки вериги от съгласни, за да раздели непрекъснатия акустичен сигнал на отделни структурни единици.