말하는 영상 아래에 깐 음악은 구체적이고 예측 가능한 방식으로 실패합니다. 곡을 고르고, 인트로가 살아 있게 들리도록 볼륨을 맞추고, 내보내기를 누릅니다. 그런데 완성된 영상은 싸움판이 되어 있습니다. 음악이 나빠서가 아닙니다. 일정한 레벨이라는 것 자체가 말에게는 틀린 모양이기 때문입니다. 목소리는 일정하지 않습니다. 요점을 향해 올라가고, 문장 끝에서 내려앉고, 숨을 쉬는 동안에는 완전히 사라집니다. 말에는 오르내림이 있고, 그 오르내림 자체가 의미의 일부입니다. 한 높이에 묶인 배경 음악은 당신이 작게 말할 때마다 너무 크고, 말을 멈추는 순간에는 너무 작습니다. 그래서 시청자의 귀는 어느 소리를 따라가야 할지 끝없이 다시 협상하게 됩니다. 더 나쁜 것은, 목소리와 음악이 같은 자리에 산다는 사실입니다. 곡을 따뜻하게 만드는 악기들 — 기타, 건반, 현, 그리고 대부분의 노래하는 목소리 — 은 사람의 말과 같은 몇 옥타브를 차지합니다. 둘은 쌓이지 않고, 서로를 가립니다. 시청자는 두 겹의 소리를 듣는 것이 아니라, 흐려진 한 겹을 듣습니다. 단어의 끝이 뭉개지고, 자음이 사라지고, 듣는 일 자체가 일이 됩니다. 곡 전체를 줄이는 것은 해결이 아닙니다. 싸움을 더 낮은 볼륨으로 옮길 뿐이고, 이제 쉬는 구간은 음악이 채워 주는 대신 텅 비어 버립니다. 결국 당신은 볼륨을 올렸다 내렸다 하며 존재하지 않는 정답을 찾게 됩니다. 문제는 레벨이 아닙니다. 레벨이 한 번도 변하지 않는다는 것이 문제입니다.
방송은 이 문제를 수십 년 전에 해결했습니다. 페이더 위에 얹은 손으로요. 잘 만든 다큐멘터리나 라디오 프로그램을 주의 깊게 들어 보세요. 음악이 한 볼륨에 머무는 일은 없습니다. 믹서가 그것을 타고 있습니다. 말의 첫 단어 아래로 큰 폭으로 내리고, 목소리가 이어지는 동안 거기에 붙잡아 두고, 진짜 쉬는 구간 — 단어와 단어 사이가 아니라 단락과 단락 사이 — 에서 다시 올립니다. 내리는 것도 일이지만, 올릴 자리를 고르는 것이 더 큰 일입니다. 듣는 사람은 그 움직임을 한 번도 알아차리지 못하는데, 바로 그것이 기술입니다. 경사는 보이지 않을 만큼 느리고, 탁 하고 꺾이는 대신 아주 짧은 시간을 들여 미끄러집니다. 효과는 이름 그대로입니다. 음악이 몸을 낮춥니다. 당신과 무대 사이에 서 있던 사람이 연극이 시작되면 몸을 숙이는 것처럼요. 몸을 숙인 사람을 쳐다보는 관객은 없습니다. 모두 무대를 봅니다. 듣는 사람이 경험하는 것은 "음악이 조용해졌다"가 아니라 "이 목소리가 중요하다"입니다. 잘된 더킹은 기술적 잔재주가 아니라 우선순위의 선언입니다. 영상 한 편에 예순 번씩, 끊임없이, 관객이 한 번도 의식하지 못하게 이루어지는 선언이요. 그 선언이 쌓여서 시청자는 이 영상이 손질된 것이라는 느낌을 받습니다. 이유는 설명하지 못해도요. 그리고 손으로 하면 영상 한 편마다 오후 하나가 통째로 들어가는 일이기도 합니다. 자동화가 존재하는 이유가 거기에 있습니다.
거칠게 만든 자동화에는 고유한 고장 방식이 있고, 거기에는 이름이 붙어 있습니다. 펌핑입니다. 순진한 더킹은 목소리를 너무 곧이곧대로 따라갑니다. 말 속의 아무리 작은 틈도 침묵으로 읽기 때문에, 음악은 단어와 단어 사이에서 부풀어 올랐다가 다음 음절에서 내리꽂힙니다. 위로, 아래로, 위로, 아래로, 당신의 호흡에 맞춰서요. 곡은 배경이기를 그만두고 심장 박동이 되고, 무엇이 잘못됐는지 말로 설명하지 못하는 청취자도 무언가 잘못됐다는 것만은 압니다. 이런 종류의 오류는 귀보다 몸이 먼저 압니다. 고치는 길은 거친 버전이 놓치는 구별에 있습니다. 모든 틈이 쉼은 아니라는 구별입니다. 두 단어 사이의 공백은 쉼이 아닙니다. 문장 중간에 숨을 들이쉬는 한 박자도 아닙니다. 진짜 쉼 — 생각의 끝, 단락의 경계, 요점 앞에 일부러 두는 1초의 침묵 — 은 음악의 복귀가 의미를 가질 만큼 깁니다. 그러니 좋은 더킹과 펌핑을 가르는 규칙은 말하기 쉽습니다. 숨보다 짧은 틈은 낮아진 채로 있어야 한다는 것입니다. 침묵이 의도라고 부를 수 있을 만큼 길 때에만, 배경 음악은 다시 올라올 자격이 있습니다. 규칙은 하나뿐이지만, 이 하나가 자동 더킹의 품질을 통째로 가릅니다.
Talk2Camera의 편집기에는 그 규칙이 내장되어 있습니다. 편집 아래에 음악 트랙을 깔고 더킹을 켜면, 믹스가 스스로를 탑니다. 당신이 말하는 동안 음악은 당신이 정해 준 레벨의 4분의 1쯤으로 내려가고, 진짜 쉬는 구간에서 다시 올라옵니다. 경사는 대략 0.3초라서, 움직임은 탁 꺾이는 대신 부드럽게 미끄러집니다. 숫자는 작지만 하는 일은 큽니다. 그 0.3초가 스위치를, 손으로 타는 페이더처럼 들리게 만듭니다. 숨보다 짧은 틈은 낮아진 채로 남기 때문에, 배경 음악이 당신의 말 리듬에 맞춰 펌핑하는 일은 없습니다. "말하는 동안"이 무엇을 뜻하는지는 테이크 자체에서 나옵니다. 아이폰에서는 테이크의 전사 기록에서, 안드로이드에서는 테이크 자체의 오디오 분석에서요. 그 말은 곧, 대본 없이 찍어서 기댈 텍스트가 하나도 없는 테이크에서도 작동한다는 뜻입니다. 즉흥으로 찍은 브이로그든, 대본을 띄워 놓고 읽은 강의든 똑같이 적용됩니다. 그리고 내보내기 과정에 사는 다른 모든 것과 마찬가지로, 이것은 결정이지 구속이 아닙니다. 원본 녹화는 손대지 않은 채 남으므로, 같은 테이크에서 튜토리얼용으로는 더킹을 켜고, 예고편 컷용으로는 끄고, 아니면 음악을 통째로 갈아 끼워서 내보낼 수 있습니다.
남은 결정들은 당신 몫이고, 그것들은 기술이 아니라 음악의 결정입니다. 트랙의 레벨은 말이 아니라 쉼에 맞춰 정하세요. 말 쪽은 더킹이 알아서 처리합니다. 당신이 고르는 레벨은 당신이 말을 멈췄을 때 시청자가 듣는 레벨이고, 너무 큰 배경 음악이 정체를 드러내는 곳이 바로 거기입니다. 쉼에서 딱 좋은 음악은 말 위에서도 얌전합니다. 배경으로 있어도 아깝지 않은 음악을 고르세요. 노래보다는 연주곡을요. 가사는 읽으라고 쓰인 것이고, 읽는 귀는 듣는 귀와 자리를 다툽니다. 당신 목소리 아래의 또 다른 목소리는 가림 현상의 최악의 형태이기 때문입니다. 극적인 곡보다는 고른 곡을요. 고조로 가득한 트랙은 더킹의 정직한 일에 자기만의 극적 연출로 맞서기 때문입니다. 그런 다음 한 번, 눈을 감고 들어 보세요. 모든 단어를 힘들이지 않고 따라갈 수 있으면서도, 쉬는 구간마다 영상에 분위기가 있다는 것이 느껴진다면, 믹스는 맞습니다. 말하는 동안 음악이 귀에 들어온다면 정해 둔 레벨이 너무 큰 것이고, 쉼이 텅 비어 느껴진다면 너무 작은 것입니다. 두 경우 모두 고치는 것은 슬라이더 하나입니다. 그 시험은 보통 한 번이면 충분하고, 고칠 것이 있다 해도 곡이 아니라 숫자 하나일 가능성이 큽니다. 페이더를 손으로 타며 보내는 오후 하나와 나란히 놓고 보면, 그것이 논증의 전부입니다.