Вдохновленный способностью мозга сосредотачиваться только на важном, новый ИИ обрабатывает видео на 65% быстрее и точнее, игнорируя большинство визуальных кадров.
Исследование
Исследователи из Японского передового института науки и технологий (JAIST) под руководством профессора Шого Окады и докторанта Хунга Ле разработали EMF-dVAE (эффективное многомодальное слияние с дискретным вариационным автоэнкодером). Модель имитирует то, как люди избирательно обращают внимание на важные моменты в разговоре, используя звуковые сигналы для принятия решения о том, когда анализировать визуальную информацию.
Во время обучения ИИ учится, какие визуальные признаки наиболее информативны, реконструируя поврежденные видеоданные. При выводе он обрабатывает только ключевые визуальные сегменты, объединяя их с аудио и языковыми данными для итоговых прогнозов.
На наборе данных ETS-Interview из 1891 двухминутных видео собеседований EMF-dVAE достиг современной точности, используя лишь 15,42% визуальных признаков. Время обработки одного видео сократилось с 52 секунд до 18—на 65%—при этом точность также повысилась, потому что избыточные кадры часто добавляют шум.
Исследование опубликовано в журнале Information Fusion (том 137, январь 2027).
Почему это важно
Этот подход, вдохновленный мозгом, подчеркивает, как избирательное внимание—ключевая когнитивная способность—может резко повысить эффективность. В повседневных задачах отфильтровывание нерелевантной информации помогает думать быстрее и принимать лучшие решения, будь то учеба, работа или просто попытка запомнить действительно важное.
Что вы можете сделать
Тренируйте избирательное внимание с помощью осознанности или игр на внимание. Перед началом задачи явно решите, что игнорировать. Это снижает умственный шум и улучшает результаты, как EMF-dVAE улучшает ИИ.
Источник: Neuroscience News
Интересует ваш мозг? Пройдите наш бесплатный адаптивный IQ-тест или попробуйте 306 уровней тренировки мозга.