Понимание того, как работает слух, позволяет более обоснованно подходить к ожиданиям относительно того, что действительно важно для воспроизведения музыки с высочайшей точностью.

Сфера воспроизведения музыки, известная как High End Audio (HEA), отличается бескомпромиссным стремлением к достижению качества звучания, максимально приближенного к живому исполнению. Используемые в HEA методы и материалы (например, атомные часы, алмазные диффузоры и т. д.) могут казаться чрезмерными или избыточными, а разработка конструкций часто включает в себя поэтапные изменения, основанные отчасти на результатах прослушивания, при которых слушатель видит оборудование (то есть без применения слепого метода).

Минимальные и порой трудноуловимые искажения, которые стремятся минимизировать в HEA, выходят за рамки стандартных технических спецификаций. Вопрос о том, насколько реально различимы на слух заявленные улучшения, остается открытым, поскольку их слышимость зачастую не подтверждается контролируемыми слепыми тестами. В совокупности эти факторы порождают значительные споры и скептицизм вокруг HEA. Однако часть этого скептицизма основана на неверном представлении о взаимосвязи временной и частотной областей, а также на непонимании принципов работы слуха.

Понимание этих концепций позволяет более обоснованно подходить к ожиданиям относительно того, что действительно важно для воспроизведения музыки с высочайшей точностью. В статье также объясняется, почему традиционные экспресс-тесты типа A-B (сравнение двух вариантов «вслепую») могут давать неверные результаты. За более подробной информацией читателям рекомендуется обратиться к недавно опубликованному обстоятельному обзорному материалу [1], а также к другим цитируемым статьям и публикациям на сайте автора.

Взаимосвязь частоты, фазы и времени

Значительная часть аудиосообщества ошибочно привержена формализму Фурье и чрезмерно полагается на терминологию частотного спектра. Например, компонент, не искажающий тембр [2], часто называют «нейтральным», подразумевая при этом ровную амплитудно-частотную характеристику (АЧХ). Более точными определениями были бы «достоверный» или «естественный», поскольку компоненты HEA (за исключением акустических систем) обычно и так обладают достаточно ровной АЧХ. Искажения [3], влияющие на тембр, связаны преимущественно с временной областью — например, с точностью передачи атаки и затухания звука, — а не с частотным спектром (да простит меня Фурье!).

На рисунке 1 представлены спектрограммы трех музыкальных инструментов. По вертикальной оси отложена частота, по горизонтальной — время, а яркость или цвет соответствуют интенсивности. Основное внимание обычно уделяется спектральному распределению энергии: у губной гармоники самый богатый спектр, насыщенный гармониками и другими обертонами; у фортепиано — наиболее чистый тон, где на этапе затухания остается лишь основная частота; скрипка же занимает промежуточное положение.

Существуют также явные различия во временной области, касающиеся того, как отдельные частотные составляющие нарастают и затухают. У скрипки основная частота начинает звучать с небольшой задержкой по сравнению с некоторыми обертонами. У губной гармоники наблюдается прогрессирующая задержка вступления более высоких обертонов. У фортепиано все обертоны возникают одновременно и резко. Кроме того, в момент начала звука между обертонами фортепиано наблюдается шум (размытость), характерный для резкого импульса [4]. 

Рисунок 1: Спектрограммы одной и той же музыкальной ноты (ми второй октавы, E5), исполненной на указанных инструментах. На врезках показаны соответствующие формы волны (графики зависимости напряжения от времени)

Вопреки распространенному мнению, именно различия во временной области, а не спектральные характеристики, оказывают наибольшее влияние на тембр. Это наглядно демонстрируется в видеоролике, доступном на YouTube, из которого для удобства в качестве примера взят Рисунок 2. Тембр кардинально меняется при воспроизведении нот в обратном направлении, хотя усредненный спектр (рассчитанный для всей формы волны) остается неизменным [6]. Это подчеркивает важность огибающей сигнала и временных характеристик для качества звучания. 

Рисунок 2: Демонстрация [5] изменения тембра при обратном воспроизведении. Тембр фортепиано при воспроизведении задом наперед становится похожим на тембр губной гармоники, несмотря на отсутствие изменений в спектре

Исключительная важность тонких временных характеристик, связанных с атакой и затуханием звука, была убедительно продемонстрирована в классическом эксперименте К. У. Бергера [7] (см. Таблицу 1). В ходе эксперимента записывались различные духовые инструменты, а затем их звучание воспроизводилось после незначительного обрезания начал и концов нот. Хотя усредненный спектр практически не менялся, удаление начальных и конечных фаз звука делало инструменты неузнаваемыми даже для профессиональных музыкантов, хорошо знакомых с их звучанием (например, шестеро из них приняли флейту за альт-саксофон, пятеро — за трубу и т. д.).

Эти наблюдения подчеркивают важность точной передачи временных характеристик звука аудиоаппаратурой. Действительно, во многих конструкциях акустических систем предпринимаются попытки обеспечить равноудаленность акустических центров излучателей от слушателя для правильного воспроизведения временных соотношений между частотными составляющими.

Таблица 1: Эксперимент Бергера с «матрицей ошибок» (confusion matrix). Устранение переходных процессов в моменты начала и окончания звука (атак и затуханий), а также малых изменений огибающей существенно искажало тембр. Таким образом, спектральные форманты не являются достаточным признаком для идентификации инструмента

Временную задержку иногда путают со сдвигом фазы. Это разные понятия, которые, как правило, не связаны между собой, за исключением особых частных случаев. Если два человека проходят через дверь, можно измерить секундомером задержку между моментами их появления. Говорить о разности фаз в отношении таких явлений — переходных, а не колебательных — бессмысленно [8].

Спектрограммы на Рисунке 1 демонстрируют относительные задержки между моментами появления (атаками) частотных составляющих, а не просто сдвиги фаз. Различие между фазой и задержкой показано в демонстрационном видео, иллюстрируемом Рисунком 3. Стандартный микс «A» (с согласованными фазами и моментами начала звука) воспроизводится попеременно с миксом «B» (где фазы различаются на 90 градусов): на качественной аудиосистеме разница практически неразличима. Затем «A» чередуется с «C», где момент появления второй гармоники задержан во времени (а не просто сдвинут по фазе); здесь изменение характера звучания слышно гораздо отчетливее. 

Рисунок 3: Демонстрационное видео [9] показывает, что тембр меняется при наличии временной задержки (b) между гармониками, но не при относительном сдвиге фаз (a)

Таким образом, временная задержка между моментами появления составляющих более существенна, чем рассогласование фаз; как уже упоминалось, во многих конструкциях акустических систем класса High-End этому уделяется особое внимание. Нечувствительность тембра к фазовым соотношениям — настолько общепризнанный факт, что он лег в основу научного закона, называемого законом Ома в акустике [10, 11, 12].

Временное размытие и разрешение в аудиосистемах

Физические системы, способные к более быстрому временному отклику, как правило, лучше воспроизводят высокие частоты и реагируют на них. Это справедливо, например, при сравнении твитера (высокочастотного динамика) с вуфером (низкочастотным динамиком): более высокая резонансная частота сопутствует более быстрому возвращению системы в состояние равновесия. Или рассмотрим RC-фильтр нижних частот: более высокая частота среза fC = 1/(2πRC) соответствует меньшему характерному времени затухания τ = RC = 1/(2πfC).

Однако между характеристической частотой и характеристическим временем процесса не всегда существует прямая обратная зависимость. Например, фильтры восстановления сигнала [13], используемые при цифровом воспроизведении и обеспечивающие наилучшие временные характеристики, могут иметь менее широкую полосу пропускания частот. Повседневные события (например, завтрак) «фазово синхронизированы» с суточным циклом. Но какое отношение продолжительность завтрака имеет к 24-часовой периодичности? Никакого!

Аналогичным образом, человеку не обязательно обладать способностью слышать более высокие частоты, чтобы различать мельчайшие временные отклонения. Разрешающая способность слуха по бинауральной временной задержке составляет 10 мкс на частоте 700 Гц, что соответствует одной сотой периода T = 1,43 мс; при этом на более высокой частоте 1 400 Гц эта способность в 10 раз хуже (>100 мкс)! Интересные аспекты нейрофизиологии слуха, объясняющие отсутствие жесткой связи между частотой, фазой и временем, а также лежащие в основе закона Ома, рассматриваются во второй части этой серии статей.

Термин «временное разрешение» используется неоднозначно и может означать разные вещи. Для определенности мы будем использовать термин «временное размытие» (обозначаемый как τ) для описания сглаживания переходных деталей сигнала — явления, аналогичного оптическому размытию изображения в телескопах. На рисунке 4a показано изображение звезды, полученное с помощью телескопа: из-за дифракции вместо четкой точки формируется так называемый «диск Эри» (дифракционная картина). Изображения двух близко расположенных звезд сливаются в одно, если угловое расстояние между ними меньше величины θC = 1,22 λ/d (где d — диаметр апертуры, а λ — длина волны), определяемой по критерию Рэлея. Это проиллюстрировано на графиках профилей интенсивности, приведенных на рисунке 4b. 

Рисунок 4: (a) Изображение звезды выглядит как размытая дифракционная картина («диск Эри»). (b) Дифракционные профили двух близко расположенных звезд перекрываются, и их невозможно различить, если угловое расстояние между ними θ < θC = 1,22 λ/d. (Рисунок адаптирован из источника [1])

Аналогичным образом, каждый компонент аудиосистемы вносит временное размытие в сигнал, увеличивая суммарный параметр τ всей системы. Два импульса, разделенные интервалом, меньшим τ, сольются в один. Следует ожидать, что это повлияет на качество звука, если величина τ превышает порог временного разрешения (TR) нашего слуха. В классических экспериментах Б. Лешовица [14] было установлено, что величина TR составляет примерно 4–10 мкс [15]. По аналогии с эффектом размытия изображений звезд (рис. 4), в данном психоакустическом исследовании оценивалась способность слушателя различать одиночные и сдвоенные импульсы равной энергии (см. рис. 5a).

Этим объясняется, почему частота дискретизации цифрового аудио 44,1 кГц (стандарт Red Book, или уровень CD) недостаточно высока. На рис. 5b показан сигнал напряжения на выходе ЦАПа [16] в случае, когда входной сигнал (WAV-файл) представляет собой импульс длительностью в один отсчет. Длительность τ сопоставима с периодом дискретизации и значительно превышает порог временного разрешения слуха. Чтобы сократить τ до уровня, при котором она перестанет быть «узким местом», потребуются значительно более высокие частоты дискретизации. Впрочем, в большинстве аудиосистем слабые звенья обнаруживаются в других частях тракта. Если частота дискретизации не является «узким местом» системы, то повышение частоты выше 44,1 кГц может не дать слышимого эффекта. 

Рисунок 5: Эксперименты Лешовица [14] показали, что слушатели способны отличить одиночный импульс (a) от двойного импульса (b), разделенных интервалом TR ~ 4–10 мкс. (c) Временное размытие (оцениваемое по ширине на полувысоте, или FWHM) цифрового аудио с параметрами CD (16 бит / 44,1 кГц) значительно превышает этот интервал TR. (Рисунок адаптирован из цитируемого источника 1)

Различение временного сдвига в цифровом аудио

В цифровом аудио существует величина времени τ* ~ 1/[2N fS], соответствующая порогу различения временного сдвига (т. е. минимальному сдвигу формы сигнала во времени, который может быть зафиксирован как изменение цифрового значения). Рисунок 6 иллюстрирует смысл этого параметра. Для качества CD величина τ* составляет менее одной наносекунды [17]. Эту крайне малую величину иногда ошибочно принимают за «временнóе разрешение». Она не имеет отношения к точности воспроизведения звука. На рисунке 5c показан результат, получаемый при попытке сформировать бесконечно узкий импульс: он оказывается в сто тысяч раз шире, чем субнаносекундный интервал τ*, а искажения низкого уровня сохраняются еще дольше. 

Рисунок 6: Различение временного сдвига в цифровом аудио. Задержка (временной сдвиг) треугольного сигнала на величину, меньшую периода дискретизации, может быть обнаружена как изменение цифровых значений отсчетов. Порог обнаружения τ* ~ [2N fS]⁻¹ значительно меньше периода дискретизации 1/fS, однако он не характеризует минимальную деталь формы сигнала, которую можно различить. Это не «временнóе разрешение»

Разрешение низкоуровневых деталей

Временнóе размытие τ соответствует интервалу времени, в течение которого сигнал падает от пикового значения до определенной доли (например, ½, 10%, 1/e и т. д.), при которой два импульса, разделенных интервалом менее τ, не могут быть различимы. Однако, если взглянуть на рисунок 5b, можно увидеть остаточный сигнал от исходного пика, сохраняющийся гораздо дольше — порядка миллисекунды, — который будет вносить искажения в последующую звуковую информацию.

Это не будет восприниматься как замедление атаки, но приведет к потере тонких деталей звучания. Ожидается, что по своему влиянию на звук этот эффект окажется хуже, чем случайный шум, поскольку он коррелирует с самим сигналом. Восприятие глубины звуковой сцены опирается на слуховой механизм [1], сравнивающий интенсивность прямого звука с интенсивностью реверберации (которая по прошествии времени реверберации оказывается на 60 дБ ниже). Утрата этой информации снижает ощущение глубины и «живости» звучания. Степень такого растянутого «размытия» можно оценить по времени полного затухания (τC), то есть моменту, когда остаточный сигнал исчезает окончательно.

Рисунок 7: (a) Первичное временное размытие (порядка сотен наносекунд) более выражено у аудиофильского межблочного кабеля S, чем у стандартного кабеля G; однако у первого наблюдается четкий спад сигнала примерно за одну микросекунду, тогда как у кабеля G сохраняются остаточные колебания, длящиеся несколько микросекунд. (b) τ60 — это время, за которое уровень сигнала снижается на 60 дБ. (Данные и рисунок адаптированы на основе источников [1] и [18])

На рисунке 7 показаны параметры первичного (τ) и растянутого (τC) временного размытия для двух типов межблочных кабелей. Эти параметры в определенной мере независимы друг от друга и могут даже демонстрировать обратную корреляцию. Примером может служить акустическая система с хорошим временным согласованием и быстрыми динамиками, но с недостаточно жестким и плохо задемпфированным корпусом: у нее будет малое значение τ, но большое τC из-за длительных остаточных вибраций корпуса. 

В настоящее время стандартные технические характеристики аудиоаппаратуры не включают параметры τ и τC. Возможно, их стоит добавить в будущий, более полный перечень характеристик. Параметр τC следует определять как момент, когда остаточный сигнал от импульса становится пренебрежимо малым. Как будет показано в следующей части этой серии статей, разрешающая способность слуха поистине астрономическая: количество вариаций, поддерживаемых паттерном нейронного возбуждения улитки внутреннего уха, содержит на 17 нулей больше, чем число всех звезд во Вселенной!

Примечания и список литературы:

[1] M. N. Kunchur, “The Human Auditory System and Audio,” Applied Acoustics, Volume 211, pp. 109507 (2023),

https://doi.org/10.1016/j.apacoust.2023.109507. Бесплатный препринт доступен по адресу: https://arxiv.org/abs/2307.00084.

[2] Тембр (или качество/окраска тона) — это характеристика, позволяющая различать ноты с одинаковой высотой, громкостью и длительностью.

[3] Если не оговорено иное, термин «искажение» используется в общем смысле для обозначения любого изменения формы волны.

[4] Спектр дельта-функции Дирака содержит все частоты.

[6] Хотя анализ спектра в скользящем окне (с узким окном) может дать некоторое представление о происходящем, это довольно косвенный и сложный способ отображения информации, которую правильнее представлять с помощью формы волны и спектрограммы.

[7] K. W. Berger, «Some factors in the recognition of timbre», Journal of the Acoustical Society of America, Volume 36, 1888 (1963).

[8] Люди часто гордятся своим знанием аппарата преобразования Фурье, однако это иногда может перерасти в дурную привычку. Любой сигнал всегда может быть преобразован из временной области в частотную. Однако иногда вместо того, чтобы сделать смысл более ясным, это может скрыть существенную информацию.

[10] G. S. Ohm, «Über die Definition des Tones, nebst daran geknüpfter Theorie der Sirene und ähnlicher tonbildender Vorrichtungen» [англ. пер.: «Об определении тона и связанной с ним теории сирены и подобных устройств для создания звука»], Ann. Phys. Chem., том 59, стр. 513–565 (1843).

[11] H. L. F. von Helmholtz, «On the Sensations of Tone» [«О слуховых ощущениях как физиологической основе теории музыки»], англ. пер. 4-го издания, выполненный A. J. Ellis (Longmans, Green and Co., Лондон, 1912).

[12] Дополнительное обсуждение закона Ома см. в разделе 3.8 статьи [1].

[13] Иногда также называемый сглаживающим фильтром, фильтром для устранения наложения спектров (anti-aliasing) или фильтром для подавления зеркальных частот (anti-imaging).

[14] B. Leshowitz, «Measurement of the two-click threshold» [«Измерение порога различения двух щелчков»], Journal of the Acoustical Society of America, том 49, стр. 462–466 (1971).

[15] В этих экспериментах использовалось оборудование, собственное временное быстродействие которого могло ограничивать точность измерений. Эксперименты необходимо повторить с использованием современного оборудования HEA для определения предельного значения TR. Нейрофизиологическое моделирование, описанное во второй части («Слуховое разрешение») данной серии статей, предполагает возможность достижения TR ~1 мкс.

[16] Muse Audio USB Mini DAC (другие протестированные ЦАП и CD-проигрыватели отличались в деталях, но имели сопоставимые значения FWHM).

[17] Где N = 16 — вертикальное разрешение (разрядность), а fs = 44. ...частота дискретизации 44,1 кГц, получаем: τ* ≈ 1 / (2¹⁶ × 44 100) = 0,35 нс

[18] M. N. Kunchur, “Cable Pathways Between Audio Components Can Affect Perceived Sound Quality”, Journal of the Audio Engineering Society, Volume 69, No. 6, pp. 398–409 (2021).

Источник: «Hearing and Audio: Part 1 — Frequency, Phase and Time»