말하는 몸
인간은 질식할 수 있는 목을 얻는 대신 소리를 잘게 쪼갤 능력을 얻었다 — 그리고 그 익숙한 이야기도 절반은 틀렸다
말은 뇌만의 성취가 아니다. 목구멍에서 공기와 음식의 길이 교차하는 순간부터, 인간은 사레들릴 수 있는 몸이 되는 대신 모음을 나눌 수 있는 관을 얻었다. 그런데 이 깔끔한 서사는 사슴과 개코원숭이와 침팬지 앞에서 잇달아 무너졌고, '언어 유전자'라 불리던 FOXP2의 적응사도 2018년에 통째로 수정됐다. 남은 것은 더 흥미로운 질문이다 — 인간에게 정말로 새로웠던 것은 목이었을까, 그 목으로 내려가는 선이었을까.
식탁에서 누군가 사레들리는 소리는, 인간이 말을 얻기 위해 치른 값을 뒤늦게 청구하는 소리다. 우리 목구멍에서는 공기가 가는 길과 음식이 가는 길이 한 지점에서 교차한다. 삼키는 순간마다 후두덮개가 기도를 짧게 봉인하고, 그 타이밍이 어긋나면 음식은 폐 쪽으로 향한다. 갓난아기는 이 위험이 거의 없다. 후두가 높이 붙어 있어서 젖을 빨면서 동시에 숨을 쉴 수 있기 때문이다. 그러다 생후 첫해부터 후두가 목 아래로 내려앉기 시작하고, 아이는 질식할 수 있는 몸이 된다. 그리고 거의 같은 시기에 말을 시작한다. 이 우연처럼 보이는 동시성이, 지난 반세기 언어 진화 논쟁의 출발점이었다.
목이 내려앉은 대가
1971년 필립 리버먼과 에드먼드 크렐린은 대담한 실험을 했다. 네안데르탈 두개골을 바탕으로 성도(vocal tract)를 복원한 뒤, 그 관이 낼 수 있는 소리를 컴퓨터로 합성한 것이다. 결론은 충격적이었다. 네안데르탈은 /i/, /a/, /u/ 같은 극단 모음을 만들 수 없었다는 것. 그들의 목은 후두가 충분히 내려오지 않아 입안과 목구멍이 직각으로 꺾이는 두 개의 관을 이루지 못했고, 따라서 모음 공간이 좁았다는 이야기였다.
여기서 나온 것이 후두 하강 가설이다. 인간만이 성체가 되어도 후두가 목 깊숙이 내려앉아, 구강과 인두가 거의 1대 1 길이로 꺾인 L자 관을 만든다. 이 두 개의 방은 혀의 위치에 따라 각각 독립적으로 공명 주파수를 바꿀 수 있다.
원리는 단순하다. 성대는 그저 웅웅거리는 원음을 만들고, 그 위의 관이 필터로 작동해 특정 주파수 대역을 키우거나 죽인다. 이렇게 강조된 봉우리를 포먼트라 부른다. 1952년 벨 연구소의 고든 피터슨과 해럴드 바니는 미국인 화자들에게 열 개의 모음을 발음시켜 첫 번째와 두 번째 포먼트를 측정했고, 그 결과를 좌표에 찍자 모음들이 삼각형에 가까운 영역에 흩어졌다. 우리가 아는 모음 공간의 지도가 그렇게 그려졌다. 말이란 결국 이 관의 모양을 초당 몇 번씩 바꿔 포먼트를 이동시키는 일이다.
그러니 이야기는 깔끔했다. 인간은 질식이라는 비용을 지불하고 모음 공간을 샀다. 몸의 타협이 언어를 낳았다. 교과서에 실리기 딱 좋은 서사였다.

그런데 사슴도 그렇다
문제는 그다음이었다. 2001년 테쿰세 피치와 데이비드 레비는 붉은사슴과 다마사슴이 울부짖는 동안 후두가 어떻게 움직이는지 관찰했다. 수컷들은 울부짖을 때 후두를 가슴뼈 근처까지 끌어내리고 있었다. 논문 제목이 그대로 결론이다. "내려앉은 후두는 인간만의 것이 아니다." 사자와 코알라도 마찬가지다. 이 동물들이 후두를 내린 이유는 모음이 아니라 허세였다. 관이 길수록 포먼트가 낮아지고, 듣는 쪽은 그 소리를 몸집이 큰 개체로 해석한다.
2003년 니시무라 다케시 연구팀은 침팬지 새끼의 성장 과정을 추적해 침팬지에게도 후두 하강이 일어난다는 것을 보였다. 정도와 시기가 다를 뿐, 인간만의 사건이 아니었다.
결정타는 2019년 《사이언스 어드밴시스》에 실린 루이장 부에 연구팀의 재분석이었다. 이들은 개코원숭이의 자연 발성을 녹음해 포먼트를 측정했다. 만약 원숭이 성도가 균일한 관이라면 계산된 성도 길이가 실측치인 13.5센티미터 근처여야 했는데, 수컷의 측정치는 23~33센티미터라는 불가능한 값을 내놓았다. 즉 원숭이는 관의 모양을 능동적으로 바꾸고 있었다. 다이애나원숭이의 경보음은 비슷한 성도 길이를 가진 열 살 남짓 아이의 /a/, /o/ 영역과 상당히 겹쳤다. 저자들은 후두 하강 가설이 "압도적으로 반박되었다"고 썼고, 말의 새벽을 20만 년 전이 아니라 2000만 년 전으로 밀어야 한다고 주장했다. 2016년 피치 연구팀이 짧은꼬리원숭이 성도를 X선으로 모델링해 "원숭이 성도는 말할 준비가 되어 있다"고 발표한 것과 같은 방향이다.
인간의 목이 특별해서 말을 하게 된 것이 아니라면, 특별해진 것은 그 목을 다루는 쪽이다.
물론 논쟁은 끝나지 않았다. 2024년 음성과학자 악셀 에크스트룀은 두 반박 논문을 조목조목 재검토하며, 개코원숭이의 모음 비슷한 소리는 인간과 전혀 다른 조음 동작에서 나왔을 가능성이 크고 원숭이가 인간 음소 전체를 낼 수 있다는 증거는 없다고 반박했다. 리버먼이 통째로 틀린 것은 아니라는 뜻이다. 지금의 합의에 가장 가까운 진술은 이렇다. 후두 하강은 말의 전제 조건이 아니었지만, 인간 성도가 넓힌 여유는 여전히 의미가 있다.

복잡함을 버려서 얻은 목소리
2022년 니시무라 팀이 《사이언스》에 발표한 결과는 논의의 축을 성도에서 성대 자체로 옮겼다. 이들은 영장류 여러 종의 후두를 폭넓게 관찰하고 수학적으로 모델링했는데, 인간에게만 없는 것이 두 가지 있었다. 성대막과 공기주머니다. 다른 영장류는 성대 위에 얇은 막이 얹혀 있어 높고 날카로운 소리를 낼 수 있지만, 대신 진동이 쉽게 무너져 주파수가 갑자기 뛰거나 카오스에 빠진다. 원숭이 울음이 기이하게 갈라지는 이유다.
인간은 그 막을 잃었다. 그래서 우리 성대는 지루할 만큼 안정적인 배음을 만든다. 그리고 원음이 안정적이어야만, 그 위에서 초당 여러 번 움직이는 포먼트의 변화가 정보로 읽힌다. 소리가 계속 요동치면 모음을 구분할 방법이 없다.
논문 초록의 마지막 문장이 이 글의 논지를 요약한다. 인간 언어의 복잡성 증가는 후두 해부구조의 단순화 뒤에 따라왔다. 말은 뭔가를 더 붙여서 얻은 능력이 아니라, 덜어내서 얻은 능력이었다.

'언어 유전자'는 없었다
목의 이야기가 이렇게 복잡하다면, 유전자 쪽은 더 심하다. 1990년대 런던에 KE라는 가계가 있었다. 4대에 걸친 30명 중 절반이 심각한 말 장애를 안고 있었고, 유전 양상은 단순한 상염색체 우성이었다. 언어학계 일부는 이들이 문법 규칙 생성에만 결함이 있다고 보고 '문법 유전자'의 증거라 불렀다.
1995년 파라네 바르가카뎀 연구팀은 같은 가족을 직접 검사한 뒤 그 해석을 뒤집었다. 이들의 결함은 문법에 국한되지 않았다. 조음 자체가 심하게 손상되어 있었고, 얼굴과 입 주위를 의도대로 움직이는 능력, 그리고 비언어적 지능까지 폭넓게 떨어져 있었다. 논문은 이 가족이 "'문법 유전자'의 존재를 지지하는 근거를 전혀 제공하지 않는다"고 못 박았다.
2001년 세실리아 라이와 사이먼 피셔 팀이 원인 유전자를 찾아냈다. 7번 염색체의 FOXP2, 전사인자를 만드는 유전자였다. 언론은 즉시 '언어 유전자'라는 이름을 붙였다. 이듬해 스반테 페보 연구실의 볼프강 에나르가 기름을 부었다. 인간과 침팬지의 FOXP2는 아미노산 두 개가 다르고, 인구유전학 통계상 최근 20만 년 안에 강한 양성선택을 받은 흔적이 있다는 것이었다. 시기가 절묘했다. 현생인류의 등장과 겹쳤으니까.
그 서사는 두 번 무너졌다. 첫 번째는 2007년, 요하네스 크라우제 팀이 네안데르탈 화석에서 인간형 FOXP2 변이를 그대로 찾아냈을 때다. 20만 년 전 스윕이라는 시나리오와 맞지 않았다. 두 번째는 2018년, 엘리자베스 앳킨슨과 브레나 헨 팀이 전 세계 수백 개 게놈으로 FOXP2를 재분석했을 때다. 최근의 양성선택도 균형선택도 나오지 않았다. 원래의 신호는 표본 구성의 인공물이었다. 초기 연구가 아프리카 밖 집단 위주에 소수의 아프리카인 표본을 섞으면서 통계량이 왜곡됐던 것이다. 저자들은 이를 "인간 진화에 필수적이라 여겨져 온 유전자의 적응사에 대한 실질적 수정"이라고 표현했다.
FOXP2가 무의미하다는 뜻은 아니다. 이 유전자는 새의 노래 학습에도 관여한다. 2007년 제바스티안 헤슬러 팀이 금화조의 기저핵에서 FoxP2 발현을 억제하자, 어린 새는 스승의 노래를 부정확하고 불완전하게 따라 했다. 다만 FOXP2는 수백 개 유전자의 스위치를 조절하는 상위 조절자이며, 그 표현형은 언어라기보다 운동 서열의 정교한 학습에 가깝다. 하나의 유전자가 언어를 만든 것이 아니라, 하나의 유전자가 망가지면 언어가 무너질 수 있을 뿐이다.

뇌에서 후두로 내려가는 선
그렇다면 인간에게 진짜로 새로운 것은 무엇인가. 유력한 후보는 배선이다. 크리스티나 시모니안의 연구를 보면, 인간의 후두 운동 피질은 일차운동피질의 뒤쪽 영역에 자리하며 연수의 의문핵으로 직접 내려가는 단일 시냅스 경로를 갖는다. 1958년 한스 카위퍼르스가 인간 뇌에서 처음 추적한 이 경로가 원숭이에게는 없다. 원숭이의 후두 피질은 망상체를 한 번 거쳐 우회하며, 그래서 그들의 발성은 대체로 본능적인 것에 머문다. 이 직결선이 최근 수백만 년 사이에 생겼다면, 그것이야말로 임의의 소리를 마음대로 학습하고 재생하는 능력의 관문일 수 있다.
배선만이 아니다. 1999년 매클라논과 휴잇은 화석의 흉추 척주관 크기를 비교해, 호모 에렉투스 이후 어느 시점에 늑간근을 정밀하게 제어하는 신경이 급격히 늘었다고 주장했다. 긴 문장을 한 호흡에 얹으려면 숨을 초 단위로 배분할 줄 알아야 한다. 말하기는 발성 이전에 호흡 관리 기술이다.
그리고 이 모든 것은 사회적으로 조율된다. 2015년 아시프 가잔파르 팀은 새끼 마모셋의 울음이 성숙하는 과정을 추적해, 부모의 반응이 언제 돌아오는가에 따라 발성의 발달 속도가 달라진다는 것을 보였다. 목소리는 혼자 익는 기관이 아니다.

3초면 복제되는 몸
목소리는 정보를 실어 나르는 동시에, 그것을 실어 나르는 몸에 관한 정보를 계속 흘린다. 사춘기에 남성의 후두는 커지고 성대는 길어져 기본 주파수가 대략 절반으로 떨어진다. 이 차이는 다른 영장류에 비해 유별나게 크다. 데이비드 퍼츠는 2006년, 낮은 목소리가 이성의 선택보다 동성 간 서열 다툼에서 더 강하게 작동한다는 실험 결과를 내놓았다. 남성 참가자들은 상대의 목소리가 낮을수록 자신이 물리적으로 밀린다고 평가했다. 회의실에서 목소리를 낮게 깔아 말하는 습관이 왜 생기는지, 여성 정치인의 피치가 왜 늘 품평의 대상이 되는지는 여기서부터 설명된다. 우리는 말의 내용을 듣기 전에 말하는 몸의 크기를 먼저 추정한다.
그래서 지금 벌어지는 일이 기묘하다. 2023년 마이크로소프트가 공개한 VALL-E는 처음 듣는 화자의 목소리를 3초 분량의 녹음만으로 복제해 임의의 문장을 읽게 했다. 같은 해 마이 연구팀이 《PLOS ONE》에 발표한 실험에서, 사람들은 합성된 음성을 신뢰할 만한 수준으로 골라내지 못했다. 훈련을 시켜도 개선은 미미했다.
수백만 년 동안 목소리는 위조가 거의 불가능한 신분증이었다. 성대의 길이도, 성도의 형태도, 그것을 제어하는 신경 회로도 개인의 몸에 붙박여 있었으니까. 목소리를 들으면 그 사람이 거기 있다는 뜻이었다. 보이스피싱이 그렇게 잘 통하는 이유도 사실 이 오래된 신뢰의 관성에 있다.
우리가 말을 얻기 위해 지불한 것이 질식의 위험이었다면, 목소리를 기계에 넘기며 지불하는 것은 목소리가 곧 그 사람이라는 전제다.
인간의 발성은 뇌가 혼자 이룬 승리가 아니었다. 숨과 삼킴과 울음을 담당하던 기관들을 조금씩 양보받고, 성대막 같은 화려한 장치를 버리고, 피질에서 후두까지 새 선을 하나 내려서 겨우 성립한 타협의 산물이다. 그 타협은 몸에 새겨져 있었기 때문에 위조되지 않았다. 이제 그 몸이 굳이 필요 없어졌을 때, 목소리는 여전히 누군가의 것일 수 있을까.