모달리티 연구노트 02 · 2026.09.02 · 네 층위 전체
M4, 상호작용을 읽는 네 층위
Mode, Modal, Modality, Medium은 무엇을 구분하는가
요즘 짧은 영상 피드에 이런 장면이 자주 뜹니다. 운전자가 차 안에서 AI를 부르면 AI가 욕설을 섞어 시비를 걸고, 운전자는 황당해하며 웃음을 터뜨립니다. 반응이 잘 나오는 종류의 영상이라 알고리즘이 계속 물어다 줍니다. 한 번쯤 보신 분이 많으실 것입니다.
테슬라 차량에 탑재된 대화형 AI 그록의 Unhinged 모드입니다. 저도 처음에는 재미있는 기능 하나가 화제가 된 정도로 넘겼습니다. 그런데 테슬라의 지원 문서를 확인해 보니, 웃고 넘길 대목이 아니라 상호작용을 어떤 단위로 나누어 봐야 하는지를 정확히 보여 주는 사례였습니다.
그록은 personality를 고를 수 있습니다. Assistant는 지시를 받아 경로를 짜고, Storyteller는 도로를 팟캐스트로 만들고, Therapist는 통근자를 달래고, Unhinged는 시비를 걸고 예측 불가능하게 반응합니다. 영상으로 퍼지는 것은 대개 마지막 하나입니다.
주목할 설계 결정이 하나 있습니다. 내비게이션 명령은 Assistant 모드에서만 작동합니다. Unhinged로 두면 목적지를 정확히 말해도 경로가 짜이지 않습니다.
왜 막았을까요. 농담하고 시비 거는 태도로 설정된 시스템이 목적지를 잡아 준다면 운전자는 그 결과를 신뢰할 수 없습니다. 같은 문장이라도 어떤 태도 위에서 발화되느냐에 따라 지시가 되기도 하고 농담이 되기도 합니다. 테슬라는 이 차이를 문장을 다듬어 해결하려 하지 않았습니다. 태도가 다르면 기능 자체를 닫는 쪽을 택했습니다.
이 장면을 네 층위로 나누어 읽으면 무엇이 그대로이고 무엇이 바뀌었는지가 드러납니다.
- Mode. 세상이 무엇으로 드러나는가. 음성과 자연어와 화면 지도, 그대로입니다
- Modal. 어떤 조건과 태도로 실현되는가. 여기만 바뀝니다
- Modality. 그 결과로 어떤 총체적 경험 구조가 성립하는가. 완전히 달라집니다
- Medium. 이 모든 과정을 담아내는 환경. 차량 실내와 단말과 망, 그대로입니다
층위를 나누지 않으면 진단이 엇갈립니다. 음성 인식을 개선하자는 처방은 Mode 층위의 조치이고, 화면 구성을 정리하자는 처방은 Medium 층위의 조치입니다. 실제로 어긋난 것은 Modal 층위였습니다.
이 네 개념을 저는 M4로 부릅니다. 기계를 설명하려고 만든 틀이 아닙니다. 사람과 사람이 마주 앉아 말하고 듣고 침묵하는 동안 의미가 어떻게 성립하는지를 묻는 데서 출발했고, 기계는 이 구조에 나중에 들어온 참여자입니다.
넷으로 나눈 근거는 임의의 분류가 아니라 퍼스의 범주론입니다. Mode는 질적 가능성으로서의 일차성에, Modal은 반작용과 제약으로서의 이차성에, Modality는 습관과 매개로서의 삼차성에 대응하며, Medium은 이 셋을 감싸는 연속체입니다.
완성된 이론이 아니라 검증에 열린 틀입니다. 반증 사례를 알려 주시면 다음 호에서 다루겠습니다.