Цель проекта: разработка носимого программно-аппаратного комплекса на базе искусственного интеллекта, который помогает незрячим и слабовидящим людям получать визуальную информацию об окружающем пространстве. Устройство получает изображение с камеры, обрабатывает его локально – без подключения к интернету – и озвучивает пользователю описание происходящего. С системой можно взаимодействовать в формате диалога: например, спросить, что находится перед человеком, прочитать вывеску или документ, уточнить информацию о светофоре либо о движении транспорта.

Эффект от внедрения: Разработка должна повысить самостоятельность и комфорт людей с нарушениями зрения в повседневных ситуациях – дома, на улице, в учреждениях и при работе с документами. В отличие от сервисов, которые зависят от облачных вычислений, модель работает непосредственно на носимом устройстве. Это позволяет использовать ее там, где нет стабильного мобильного интернета или Wi‑Fi, а также повышает конфиденциальность: изображения документов и окружающей среды не требуется отправлять на внешний сервер. В перспективе разработка может войти в перечень субсидируемых технических средств для незрячих людей.

Руководитель проекта:  Окунев Алексей Григорьевич, директор Института интеллектуальной робототехники

Разработчики Анна Некрасова и Владислав Пучков.

Ассистент незрячего человека «ИИ-поводырь»

– Расскажите, пожалуйста, что представляет собой ваш проект?

– Это носимое устройство с камерой и встроенной моделью искусственного интеллекта. Камера получает изображение, модель анализирует его и формирует текстовое описание среды, которое затем озвучивается пользователю. Если говорить проще, устройство должно помогать человеку «слышать» визуальную информацию: понимать, что находится вокруг, читать текст, получать сведения о предметах и ориентироваться в типовых ситуациях.

Система работает в диалоговом формате. Человек может не ждать общего описания, а задать вопрос: что написано на вывеске, где расположен нужный предмет, что находится перед ним, есть ли рядом автомобили или что показывает светофор.

– Значит, это не просто программа распознавания предметов?

– Да, задача шире: ассистент должен не только назвать объект, но и объяснить его положение и контекст. Пользователь может уточнять запросы и получать описание ситуации в естественной форме. Например, человек может показать камерой документ и попросить прочитать его. Или спросить, есть ли перед ним движение транспорта. В дальнейшем устройство должно помочь найти предмет: например, телефон на столе. Тогда система сможет подсказать, где находится объект – слева, справа, перед пользователем, а также примерно оценить расстояние до него.

– В чем практическая польза устройства для человека с нарушением зрения?

– Ассистент может дать человеку больше независимости в ситуациях, где обычно требуется помощь сопровождающего. Например, при посещении врача, в банке, в юридической организации или при получении документов. Если система надежно читает текст, пользователь может самостоятельно ознакомиться с содержанием бумаги, прежде чем что-либо подписывать. Это особенно важно для личной конфиденциальности. Человеку не всегда удобно просить другого прочитать медицинское заключение, договор, заявление или уведомление. Носимый ассистент может предоставить такую информацию напрямую, через наушники.

– Почему важно, чтобы система работала без интернета?

– Большие языковые модели обычно запускают на мощных серверах: пользователь отправляет данные в сеть, а затем получает ответ. В нашем случае модель развернута прямо на устройстве. Это значит, что изображение не нужно передавать в облако и ждать обработки на удаленном сервере. Такой подход важен по нескольким причинам. Во-первых, устройство можно использовать в местах с нестабильной связью или без доступа к интернету. Во-вторых, повышается конфиденциальность, о которой говорили: информация остается внутри устройства и не передается внешнему сервису.

– Насколько сложная модель используется в разработке?

– Сейчас в устройстве используется модель примерно на 9 миллиардов параметров. Для носимого устройства это довольно крупная модель. Поэтому прототип пока получается достаточно большим и тяжелым. Но именно это позволяет использовать более мощную систему, которая знает десятки тысяч классов объектов и может работать не только с короткими командами, но и с развернутыми запросами пользователя.

– Какие функции уже доступны?

– Прототип может описывать окружающую обстановку, читать вывески, объявления и документы, а также отвечать на вопросы по изображению. Пользователь, например, может спросить о ситуации на перекрестке или о наличии транспорта перед собой. Если автомобили хорошо видны в кадре, система может сообщить, что они находятся перед человеком или стоят в одной линии.

Сейчас создаем функцию поиска предметов. Она должна помочь пользователю найти вещь в комнате или на столе и получить подсказку о ее направлении и примерном расстоянии. Еще одно направление работы – предупреждение о препятствиях. Однако эта задача сложнее, поскольку само понятие препятствия зависит от ситуации, а быстрые небольшие объекты – например, самокаты – особенно трудно надежно распознавать в движении.

– На какой стадии находится проект?

– Сейчас это прототип. Полевые испытания с пользователями еще не проводились. Команда готовит второй экземпляр устройства: после закупки необходимого оборудования его планируют передать заказчику для тестирования и получения обратной связи.

– Кто сможет использовать разработку после завершения работ?

– По нашей информации, заказчик – МНТК – рассматривает возможность включить устройство в перечень субсидируемых технических средств для незрячих людей. В таком случае пользователи смогут получать его через действующий механизм поддержки, а не покупать как коммерческий продукт. 

Но на данном этапе наша задача – создать и доработать технологическую основу: программное обеспечение, модель искусственного интеллекта и принципы работы устройства. Изготовление серийных экземпляров предполагается организовать совместно с партнером после испытаний и дальнейшей адаптации решения.