Большинство людей ассоциируют домашний кинотеатр с массивной стеной из динамиков и сабвуфером, от которого вибрируют половицы. Это классический кинематографический опыт. Но давайте будем честны. Не у всех есть достаточно квадратных метров для полноценной системы 5.1. Многие арендаторы просто хотят смотреть Netflix, не превращая свою гостиную в джунгли из кабелей. Вам не нужна выделенная медиа-комната, чтобы получить это погружающее ощущение. Вам просто нужен виртуальный объемный звук.
Эта технология имитирует пространственные эффекты многодинамичной системы, используя значительно меньшее количество компонентов. Вы покупаете не новые стены. Вы покупаете определенный тип обработки аудио.
Существует два основных вида этой технологии. Первый — система 2.1 surround (объемный звук 2.1). Обычно это означает два передних динамика и отдельный сабвуфер. Вот и всё. Несмотря на название, подразумевающее простоту, эти системы предназначены для того, чтобы обмануть ваш мозг, заставив его воспринимать полный объемный звук пятидинамичной системы. Второй вариант — цифровая проекция звука. Они, как правило, используют одну полосу небольших динамиков. Часто в них отсутствует выделенный сабвуфер, и они полагаются на саму полосу для проецирования звука по всей комнате.
Независимо от аппаратного обеспечения, цель одинакова. Система изменяет звуковые волны так, чтобы они казались исходящими из мест, где нет физических динамиков. Это не магия. Это психоакустика. Речь идет о том, как люди воспринимают звук. Понимая особенности человеческого слуха, инженеры могут заставить два динамика звучать как пять.
Как ваш мозг отображает пространство
Чтобы понять, почему это работает, нужно взглянуть на «аппаратное обеспечение» вашей собственной головы. Динамик — это по сути машина, которая преобразует электрические импульсы в физическое движение. Он использует диафрагму. Этот конус быстро движется вперед и назад. Когда он выдвигается наружу, он создает сжатие. Это область высокого давления в воздухе. Когда он оттягивается назад, он создает разрежение. Это область более низкого давления.
Эти сжатия и разрежения распространяются через воздух в виде продольной волны. Они обусловлены движением воздушных частиц. Когда частицы толкают друг друга, давление возрастает. Когда они расходятся, давление падает. Эта волна в конечном итоге достигает вашего уха.
Она попадает в ушную раковину, также известную как ушная раковина (pinna). Это внешняя часть вашего уха. Звук затем проходит вниз по слуховому проходу. Он физически приводит в движение вашу барабанную перепонку, или тимпанальную мембрану. Это запускает цепную реакцию крошечных структур внутри. В конечном итоге вибрации достигают слухового нерва. Нерв посылает эти импульсы в ваш мозг. Ваш мозг интерпретирует их как звук.
Но слух — это не только обнаружение громкости или высоты тона. Ваш мозг использует звук для определения его источника. Это происходит с помощью аурикулярных подсказок (слуховых ориентиров). Вы можете не задумываться об этом сознательно, но ваш мозг постоянно вычисляет, откуда исходит звук. Это эволюционный навык выживания. Животные используют его для поиска пищи или избегания хищников. Люди используют его, чтобы определить, стучат ли в их дверь или в дверь соседа. Если вы можете определить источник, вы можете отреагировать.
Системы виртуального объемного звука используют эти подсказки. Они изменяют звуковые волны так, что ваш мозг получает противоречивые или измененные данные. В результате возникает фантомное изображение. Вы слышите звук, исходящий сзади вас, даже если динамик находится перед вами.
Подход алгоритма Dolby
Одним из наиболее известных методов создания такой среды является Dolby Virtual Speaker. Это не физическое устройство. Это набор правил и алгоритмов. Эти правила воссоздают многоканальный звук для устройств, которые имеют только два обычных динамика.
Вы найдете эту технологию встроенной в определенные телевизоры, стереосистемы и компьютеры. Она обрабатывает аудиосигнал перед тем, как он достигнет драйвера (динамика). Алгоритм манипулирует временными характеристиками и частотой звуковых волн. Он обманывает локализационные подсказки мозга. Эффект аналогичен Dolby Headphone. Эта технология использует алгоритмы обработки звука, позволяющие обычным наушникам имитировать настройку динамиков объемного звука.
Этот подход устраняет необходимость в сложной проводке. Вам не нужно сверлить отверстия в стенах. Вам не нужно измерять расстояния между динамиками. Обработка происходит в цифровом виде. Аппаратное обеспечение должно просто иметь возможность выводить стереосигнал.
Это поднимает простой вопрос. Почему стоит бороться с физикой, когда можно просто обмануть мозг?
Механика определения направления звука
Вы находитесь в тихом экзаменационном зале. Воздух неподвижен. Внезапно падает монета.
Ваша голова резко поворачивается в сторону звука. Это происходит так быстро, что вы даже не задумываетесь об этом. Это инстинкт. Ваш мозг за долю секунды вычисляет источник. У вас может быть слух только в одном ухе. Это всё равно работает. Как?
Мозг — это вычислительный механизм. Он принимает сырые данные от ушей и запускает сложный аналитический процесс. Существует два основных входа. Один — это разница между тем, что слышит правое ухо, и тем, что слышит левое. Другой — это то, как звуковые волны отражаются от вашей головы и тела. Это слуховые подсказки. Мозг использует их для триангуляции местоположения.
Подумайте снова о монете. Она падает на пол справа от вас.
Звук распространяется в виде физических волн. Он движется с конечной скоростью. Это занимает время. Волна сначала достигает вашего правого уха. Спустя долю секунды она достигает левого.
Также происходит снижение громкости. Звук тише в левом ухе. Почему? Волна естественным образом рассеивается. Ваша голова поглощает часть звука. Часть отражается. Это создаёт разницу.
У этой разницы есть название. Это межушная разница уровней (ILD).
Разница во времени — это ещё одно название. Это межушная разница во времени (ITD).
Эти два показателя дают вашему мозгу чёткое представление. Звук слева или справа? Ответ обычно да.
Но что насчёт высоты? Это сложнее.
Если звук находится над вами или под вами, путь к вашим ушам меняется. Длина пути варьируется. Но разница между левым и правым ухом остаётся одинаковой. ILD и ITD не изменяются с высотой. Поэтому мозгу трудно.
Перед или сзади — ещё сложнее.
Если полагаться только на разницу во времени и уровне, можно запутаться. Звук позади вас может создавать точно такие же ILD и ITD, как и звук спереди. Точки данных совпадают. Местоположение — нет.
Это создаёт проблемную зону. Это конусообразная область, extending outward from your ear. Мы называем её конусом путаницы.
Внутри этого конуса числа идентичны. Ваш мозг не может различить перед и сзади, используя только время и громкость.
Это предполагает, что у вас два работающих уха. А если нет?
Если у вас слух только в одном ухе, вы всё равно можете локализовать звук. Мозг адаптируется. Он обращает внимание на отражения. Он анализирует, как звук отражается от поверхностей в этом единственном ухе. Это не идеально. Но это работает.
Когда звуковая волна достигает вас, она не просто отражается от барабанной перепонки. Она ударяется о вашу голову. Она ударяется о ваши плечи. Она огибает изогнутую раковину вашей наружной части уха. Каждое отражение subtly изменяет волну. Эти отражения интерферируют друг с другом. Части волны усиливаются. Части ослабевают. Это изменяет громкость и качество звука.
Эти изменения известны как голововые функции передачи (HRTF).
В отличие от межуховых разниц в уровне (ILD) или межуховых временных разниц (ITD), HRTF отвечают за определение высоты звука. Они сообщают вам, исходит ли звук сверху или снизу. Они также различают переднюю и заднюю части. Мозг анализирует эти искажения волны, чтобы точно определить источник.
Почему мы не можем измерить HRTF на слух
Человеческая ушная раковина — это лабиринт. Она имеет бесчисленное множество поверхностей. Большинство из них изогнуты. Звук отражается от одной поверхности, попадает на другую и снова отражается, прежде чем достичь барабанной перепонки.
Добавьте к этому лицо. Голову. Волосы. Торс.
Попытка вручную изолировать эти отражения практически невозможна. Взаимодействия слишком сложны. Ученым нужны были данные. Множество данных.
Они использовали источники звука. Они использовали массивы микрофонов. Они использовали компьютерные программы.
Роль KEMAR в исследованиях HRTF
Исследователи не просто догадывались. Они измеряли.
В некоторых исследованиях они прикрепляли крошечные микрофоны непосредственно к телам человеческих участников. В других они использовали реалистичные манекены. Эти манекены имитируют человеческую кожу, хрящи и пропорции.
Самым известным является Knowles Electronic Manikin for Acoustic Research (KEMAR). Он стал неотъемлемой частью лабораторий, таких как MIT Media Lab.
Почему манекены? Потому что каждая голова уникальна. Каждая форма уха индивидуальна. Чтобы создать универсальную модель, необходима стандартизация. KEMAR обеспечивает эту базовую линию.
HRTF — это, по сути, отпечаток пальца того, как ваше тело фильтрует звук. Без них аудио лишается глубины.
От измерения к алгоритму
У микрофонов одна задача: захватывать звук.
Затем компьютеры анализируют различия. Они изучают, как один и тот же звук взаимодействует с разными частями тела. Они отслеживают звуки из разных точек происхождения.
Эти данные приводят к созданию алгоритма.
Алгоритм здесь — это просто набор правил. Он описывает, как HRTF и другие факторы изменили форму звуковой волны. Если применить этот алгоритм к новой звуковой волне, он изменит форму этой волны. Он придаст ей те же свойства, которые имела исходная волна после взаимодействия с телом.
Это двигатель, лежащий в основе виртуального объемного звука.
Как работает виртуальный объемный звук
Вот что происходит, когда вы надеваете наушники, которые утверждают, что имитируют систему объемного звука 5.1.
- Захват: Исследователи используют микрофоны для записи звука с физической акустической системы 5.1. Запись ведется с уровня ушей и тел различных форм и размеров. Это учитывает индивидуальные различия в восприятии.
- Моделирование: Используя компьютеры, они разрабатывают алгоритм. Этот алгоритм воспроизводит пространственные характеристики этого реального звукового поля.
- Применение: Алгоритм применяется к двухканальной (стерео) системе. Он изменяет форму аудио. Результатом является звуковое поле, которое имитирует форму реальной системы с 5 каналами.
Вы слышите симуляцию. Ваш мозг обрабатывает измененное HRTF аудио так, как если бы звуки исходили из конкретных направлений в пространстве.
Это не магия. Это математика. И именно поэтому фильм кажется захватывающим, даже когда вы находитесь в комнате в одиночестве.
Инструменты и методы виртуального объемного звука
Это трюк. Сложный цифровой фокус. Процессор берет ваш стандартный стереосигнал и искажает его с помощью акустических подсказок. Сдвиг фазы. Подавление частот. Линии задержки. Он заставляет ваш мозг принять ложь: что звук исходит из пяти различных точек в пространстве, а не просто из двух динаков слева и справа. Вы не слышите больше. Вам просто внушают, что слышите.
В этом заключается основная обещание инструментов виртуального объемного звука. Они не добавляют аппаратное обеспечение. Они добавляют обман.
Подход на основе ЦОС: формирование сигнала
Большинство потребительских решений полагаются на цифровую обработку сигнала (ЦОС). Это не магия; это математика, примененная к звуковым волнам. Программное обеспечение анализирует входящую стереодорожку и применяет функции передачи, связанные с головой (HRTF). Эти функции моделируют то, как ваши уши и голова фильтруют звук, исходящий с разных направлений.
Искусственно изменяя время и интенсивность частот между левым и правым каналами, система создает «фантомные изображения». Ваша слуховая кора заполняет пробелы. Она размещает звук позади вас или сбоку, основываясь на тонких подсказках, которым ваш мозг научился доверять.
Аппаратные и программные решения
У вас есть выбор. Они различаются по эффективности и стоимости.
- Программная виртуализация: Работает на вашем ПК, игровой консоли или смартфоне. Такие приложения, как Dolby Atmos для наушников или Sony 360 Reality Audio, берут микс 5.1 или 7.1 и конвертируют его. Это удобно. Но звук часто кажется тонким. Профили HRTF являются усредненными. Они предполагают среднюю форму головы. Если ваша голова не является средней, иллюзия разрушается.
- Аппаратное апмикширование: Некоторые AV-ресиверы и высококлассные звуковые панели делают это внутренне. Они обрабатывают сигнал перед тем, как он попадает на динамики. Установка 5.1 может симулировать опыт 7.1 или даже 9.1, используя задние динамики и каналы верхнего уровня для заполнения пустот. Это меньше зависит от точности HRTF, поскольку вы используете реальные физические динамики.
- Форматы амбисоники: Здесь становится технически интересно. Амбисоника записывает звук как сферу. Она записывает информацию о направлении напрямую. При воспроизведении через инструменты виртуального объемного звука панорамирование более точно. В основном используется в VR-гарнитурах. Если вы просто смотрите фильм на диване, вы, вероятно, не заметите разницы.
Почему это важно для обычных пользователей
Вам не нужен кинотеатр. Вам нужно погружение.
Проблема стереозвука в том, что он плоский. Все происходит перед вами. В фильмах экшен теряют свою пространственную глубину. Музыка теряет свою широту. Виртуальный объемный звук исправляет это, расширяя звуковую сцену. Это не настоящий объемный звук. Это убедительное приближение.
Для геймеров это критически важно. Пространственный звук может означать разницу между обнаружением врага за стеной и тем, чтобы быть обойденным с фланга. Подсказки должны быть точными. Плохо настроенная HRTF может полностью скрыть шаги.
Где это терпит неудачу
Иллюзия хрупка.
- Движение головы: Если вы поворачиваете голову, звук остается зафиксированным на динамиках. Он не вращается вместе с вами. Это мгновенно разрушает пространственную иллюзию.
- Форма ушей: У всех разные ушные раковины. Фильтры, используемые в большинстве программ, являются усредненными. Если ваши уши по-разному улавливают высокие частоты,
Механика имитации объемного звука
Виртуальные системы объемного звука полагаются не только на физику; они «взламывают» ваш мозг. В то время как настоящие системы 5.1 используют реальные динамики для отражения звуковых волн по комнате, цифровые системы обработки звука пытаются обмануть вас, заставив воспринимать пространство. Они отражают звуковые волны от ваших стен. Если волна отражается от стены позади вашей головы, ваш мозг регистрирует её как исходящую сзади.
Это требует точности. Необходимо задать размеры комнаты или использовать калибровочный микрофон. Если угол будет неверным, иллюзия разрушится.
Отмена и интерференция
Многие двухколоночные системы используют отмену перекрестных помех (crosstalk cancellation). Это творческое применение деструктивной интерференции. Цель проста: не дать левому уху слышать аудиосигнал правого канала.
Если ваши уши улавливают сигналы друг друга, стереоизображение разрушается. Система использует алгоритмы для устранения этого нежелательного проникновения сигнала. Это не магия. Это обработка сигнала.
Вычислительная мощность, стоящая за звуком
Этим алгоритмам нужна вычислительная мощь. Компьютерный процессор, обычно находящийся внутри ресивера или усилителя, выполняет основную работу. Этот чип обрабатывает звуковые волны в реальном времени. Он принимает входные данные от DVD-плеера или спутникового ресивера. Применяет математические вычисления. Регулирует громкость. Затем отправляет чистый сигнал на динамики. В некоторых системах это оборудование скрыто непосредственно в самих акустических колонках.
Проблема «сладкой точки»
Вот в чем подвох. Погружение — это иллюзия. Она работает только в том случае, если вы сидите в правильном месте. Вы должны смотреть прямо на экран.
Если вы сместитесь влево или вправо от сладкой точки (sweet spot), эффект исчезнет. Вы выйдете за пределы направленного звукового поля. Звуки, панорамируемые по комнате, могут заикаться или звучать неестественно. Вы слышите два динамика, которые притворяются пятью. Результат лишен физической мощи полноценной массивной системы объемного звука.
На что обратить внимание при покупке
Перед покупкой проверьте следующие факторы.
- Размер и форма комнаты: Цифровая проекция звука полагается на отражения. Она не работает в огромных открытых пространствах или комнатах с неправильной формой стен.
- Желаемый эффект: Хотите звук, заполняющий всю комнату? Двухколоночная система может разочаровать.
- Сабвуфер: В системах 2.1 он входит в комплект. Многие системы цифровой проекции его не имеют. Вы можете добавить его для низких частот, но это потребует дополнительных расходов.
- Требования к настройке: Некоторые системы готовы к работе сразу после подключения (plug-and-play). Другие требуют измерения комнаты и запуска процедуры калибровки.
- Цена: Доступные системы 2.1 существуют. Высококлассные устройства цифровой проекции могут стоить более 1500 долларов.
Технология впечатляет, пока вы сидите. Как только вы встаете, это просто эхо.
Где углубиться в науку об аудио
Если вы хотите выйти за рамки основ и понять, как именно звуковые волны отражаются от стен или как наушники обманывают ваш мозг, заставляя его слышать кинотеатр, путь усеян разнообразными ресурсами. Начните с фундаментальных руководств. Как работает домашний кинотеатр задает основу. Затем вам нужно понять аппаратное обеспечение. Как работают динамики объясняет механику. Как работает звук в фильмах погружает в процесс сведения.
В этой области есть и странные, удивительные аспекты. Как работает LRAD охватывает устройства дальнего звукового действия. Как работает акустическая левитация звучит как научная фантастика, но является реальной физикой. А для экранов Как работают телевизоры — это только начало. Нужно смотреть на панели. Как работают DLP-проекторы. Как работают плазменные дисплеи. Как работает ЖК-технология. И если вы чувствуете ностальгию или просто любопытны по поводу устаревших технологий, Как работает SED-TV — это увлекательное отклонение от курса. Затем есть Как работает HDTV, чтобы связать всё это с высоким разрешением.
Но самое интересное содержится в сравнениях. У Popular Mechanics есть хорошая статья о Многоканальном звуке против виртуального объемного звучания. Она отсеивает маркетинговый шум. Хотите сухие данные? Обратитесь в Институт исследований звука и вибраций (Institute of Sound and Vibration Research). Они ничего не продают. Они просто изучают вибрации. В Мичиганском государственном университете (Michigan State) сильный акцент на Акустике/Психоакустике. Здесь психология встречается с физикой. А для тех, кто хочет погрузиться в математику, поищите Локализацию звука с использованием функций передачи головы (HRTF).
Исследования, стоящие за иллюзией
Это не просто мнение. Это измеренные факты.
«Мозг не слышит динамики. Он слышит сцену.»
Наука опирается на конкретные измерения. Измерения манекена (Manikin Measurements) Буркхеда от компании Industrial Research Products, Inc. предоставляют исходные данные. PDF-файл все еще можно найти. Он показывает, как звук попадает на искусственную голову. Это точно.
Затем есть когнитивная сторона. Работа Коппина в Университете Райса (Rice University) по Локализации звука с использованием функций передачи головы доказывает, что наш мозг использует тонкие временные различия для размещения звука в трехмерном пространстве. Это не магия. Это геометрия и задержка.
Dolby работает с этим уже много лет. Их технология Dolby Headphone разработана специально для стереонаушников. Она имитирует объемный звук. Она создает ширину. Их Dolby Virtual Speaker делает нечто подобное, но для домашних кинотеатров без тыльных динамиков. Это компромисс.
Иво Эймс в Sound on Sound разобрался в вопросе Как работает виртуальное объемное звучание еще в 2004 году. Он не уходил от прямых ответов. Он объяснил фильтры и психоакустическое маскирование. Это сложно.
Джон Фальконе в Cnet задал вопрос потребителей: Стоит ли виртуальное объемное звучание?. Ответ никогда не бывает простым «да». Это зависит от исходного материала.
Функции передачи головы (HRTF) являются ключевыми. Университет Майами (University of Miami) поддерживает хорошее вводное руководство. Оно объясняет, почему одни люди слышат объемный звук, а другие слышат просто «приглушенный» звук. Ваши уши уникальны. Форма вашей головы имеет значение.
Институт исследований звука и вибраций (Institute of Sound and Vibration Research) в Саутгемптоне имеет архивы, уходящие корнями в прошлые десятилетия. Если вы хотите понять, почему фильм кажется «масштабным», посмотрите туда.
Кристиан Кёбель в GotFrag Hardware осветил Виртуальное объемное звучание в 2006 году. Он рассмотрел аппаратные реализации. Дешевые. Дорогие. Разница заключается в вычислительной мощности.
Джек М. Лумис определил Психоакустику для AccessScience. Это наука о восприятии. Не только ушей. Мозга.
Страница Мичиганского государственного университета (Michigan State) о Локализации источников звука — это быстрое чтение. Она ясна. Она точна.
SRS Labs продвигала технологию TruSound XT. Они утверждали, что превращают стерео в объемный звук. Это было спорно. Это работало, но искажало звук.
Эрик Тауб в New York Times написал статью Сладкое обманчивое звучание виртуального звука. Он назвал это трюком. Он был прав. Но это полезный трюк.
Vann’s предложил руководство по Получению 5.1 объемного звука от двух динамиков. Речь идет о размещении.


































