Cайт программиста Ruby, веб-разработчика Ruby on Rails ESV Corp. Екатеринбург, Москва, Санкт-Петербург, Новосибирск, Первоуральск

Паспорт говорит одно, голос — другое. Искусственный интеллект научился узнавать настоящий возраст по речи

Возраст теперь можно не только считать по годам, но и искать в паузах, высоте тона и выборе слов. Международная команда создала «речевые часы», которые по аудиозаписи оценивают возраст человека и вычисляют разницу между прогнозом модели и числом прожитых лет. Работу опубликовали в Science Advances, а результат оказался связан с состоянием мозга и когнитивными функциями.

Модель обучили на записях 2928 испаноязычных участников из Аргентины, Чили, Колумбии, Мексики и Перу. В выборку вошли здоровые люди, а также участники с лёгкими когнитивными нарушениями, болезнью Альцгеймера и несколькими формами лобно-височной деменции. Алгоритм извлекал из речи более 700 акустических и языковых признаков. В расчёт попадали скорость речи, паузы, высота голоса, словарный запас, конкретность слов и эмоциональная окраска. Затем система выдавала «речевой возраст», после чего авторы сравнивали его с хронологическим. Положительный разрыв означал, что речь по совокупности признаков выглядела старше, чем ожидалось для человека такого возраста.

У здоровых участников разрыв между двумя возрастами обычно был минимальным. У людей с когнитивными нарушениями и деменцией речь чаще выглядела старше паспортного возраста, причём самые большие отклонения наблюдались при языковой форме лобно-височной деменции. Связь проявлялась также в тестах памяти, внимания, языка и повседневных функций.

Речевой возраст совпал не только с результатами когнитивных тестов. Более «старая» речь была связана с признаками ускоренного эпигенетического старения, оценками возраста мозга по МРТ и, у людей с болезнью Альцгеймера, с более высоким уровнем p-tau217 в крови. Этот белок применяют как биомаркер патологических изменений, связанных с заболеванием.

Подход продолжает идею биологических часов, которые измеряют не дату рождения, а отклонение организма от типичной возрастной траектории. Раньше для подобных моделей чаще использовали ДНК, белки крови или снимки мозга. Речь заметно дешевле собирать и можно записывать многократно без лаборатории, поэтому авторы рассматривают речевые часы как доступный кандидат для масштабных исследований.

Превращать запись голоса в диагноз пока нельзя. Работа была поперечной, то есть большинство участников проверили единомоментно, а не наблюдали годами. Модель обучали только на испанской речи в пяти странах Латинской Америки, поэтому перенос на другие языки и культуры ещё предстоит проверить. Старший «речевой возраст» показывает статистическую связь, а не доказательство ускоренного старения конкретного человека.

SecurityLab