Sign In

AI가 발달장애인의 말을 놓치는 이유

모
모멘타

"분명히 말했는데, 왜 전혀 다른 문장이 나오지?"

음성으로 메시지를 작성하거나 스마트폰에 질문했는데 엉뚱한 문장이 나온 경험이 있을 것입니다.
일부 발달장애인에게는 이런 일이 더 자주 생길 수 있습니다. 여러 번 다시 말해도 같은 부분이 삭제되거나 전혀 다른 단어로 바뀝니다.
가족은 그 말을 알아듣는데 음성인식은 알아듣지 못하기도 합니다.
이때 우리는 쉽게 이렇게 생각합니다.
"발음이 정확하지 않아서 그런가?"
하지만 문제를 개인의 발음으로만 설명하면 중요한 사실을 놓치게 됩니다.

음성인식은 소리를 그대로 받아쓰지 않습니다

STT는 Speech-to-Text의 줄임말입니다. 사람이 말한 음성을 글자로 바꾸는 기술입니다. ASR, 즉 자동음성인식이라고도 부릅니다.
음성인식은 녹음된 소리를 그대로 복사하지 않습니다. 학습한 수많은 음성과 문장 패턴을 바탕으로 사용자가 어떤 말을 했을 가능성이 높은지 계산합니다.
문제는 여기에 있습니다.
AI가 많이 배운 발음과 문장은 잘 찾을 수 있지만, 충분히 배우지 못한 발음과 말의 리듬은 다른 단어로 바꿀 수 있습니다.
STT가 알아듣지 못했다는 것은 그 사람의 말이 틀렸다는 뜻이 아니라, 모델이 그 말의 패턴을 충분히 배우지 못했다는 뜻일 수 있습니다.

첫 번째 이유: 학습한 음성이 다릅니다

일반 음성인식은 많은 사람이 사용하는 음성을 중심으로 만들어집니다.
그런데 사람의 말은 모두 같지 않습니다. 일부 발달장애인은 다음과 같은 발화 특성을 보일 수 있습니다.
•
특정 소리를 다른 방식으로 발음함
•
말의 속도와 리듬이 일정하지 않음
•
단어나 음절을 반복함
•
문장 사이에 긴 멈춤이 있음
•
목소리의 크기와 높낮이가 크게 달라짐
•
자신만의 말이나 소리로 의미를 표현함
모델의 학습자료에 이런 음성이 충분하지 않다면, AI는 익숙하지 않은 소리를 자신이 알고 있는 흔한 단어로 바꾸려고 합니다.
모델에게는 가장 가능성이 높은 문장일 수 있지만, 당사자가 실제로 말한 내용과는 다를 수 있습니다.

두 번째 이유: 같은 진단명 안에서도 말이 모두 다릅니다

'발달장애인의 음성'이라는 하나의 표준 음성이 존재하는 것은 아닙니다.
같은 진단을 받은 사람이라도 발음, 목소리, 말의 속도와 사용하는 표현이 다릅니다. 같은 사람의 말도 피곤함, 감정, 장소와 건강상태에 따라 달라질 수 있습니다.
관련 영어 마비말 연구에서는 한 데이터셋 안의 새로운 화자를 인식할 때 단어오류율이 10.71%였지만, 다른 장애 원인과 녹음조건을 가진 데이터셋에서는 39.56%로 높아졌습니다.¹
이 수치는 발달장애인 전체의 성능을 뜻하지 않습니다. 다만 한 집단에서 잘 작동한 모델이 다른 화자와 상황에서도 똑같이 작동한다고 볼 수 없다는 점을 보여줍니다.

세 번째 이유: 연습한 단어와 일상대화는 다릅니다

조용한 공간에서 정해진 단어를 읽는 것과 실제 생활에서 대화하는 것은 다릅니다.
일상대화에는 주변 소음, 웃음, 호흡, 겹쳐 말하기와 갑작스러운 주제 변화가 포함됩니다. 문장이 완성되기 전에 멈추거나 말 대신 몸짓과 표정을 사용할 수도 있습니다.
한국어 말소리장애 의심 아동 137명의 제한된 평가단어를 사용한 연구에서는 대상 자료로 미세조정한 모델이 10.25%의 음소오류율을 기록했습니다.²
이는 특화된 자료로 학습하면 인식 가능성을 높일 수 있다는 의미가 있습니다. 그러나 73개 평가단어의 결과를 소음이 있는 일상대화나 모든 발달장애 아동의 음성으로 확대해서는 안 됩니다.

네 번째 이유: 음성만으로는 뜻을 알 수 없는 경우가 있습니다

가족이 당사자의 말을 잘 이해하는 것은 소리만 정확히 듣기 때문이 아닐 수 있습니다.
가족은 다음과 같은 정보를 함께 사용합니다.
•
지금 어디에 있는지
•
바로 전에 무슨 일이 있었는지
•
당사자가 무엇을 보고 있는지
•
표정과 몸짓이 어떤지
•
평소 이 상황에서 어떤 표현을 사용하는지
•
질문에 어떤 반응을 보이는지
예를 들어 같은 소리도 식사 전에는 "배고파요"라는 뜻이고, 외출 중에는 "집에 가고 싶어요"라는 의미일 수 있습니다.
일반 STT는 대부분 이 관계와 경험을 알지 못합니다. 음성파일 안에 들어 있는 소리만으로 문장을 정해야 합니다.
따라서 문제는 귀의 정확도만이 아니라 사용할 수 있는 맥락정보의 차이이기도 합니다.

연구에서도 사람마다 큰 차이가 나타났습니다

영어 마비말 음성 연구에서는 발화 중증도가 높은 집단의 단어오류율이 30.51%로, 중증도가 매우 낮거나 낮은 집단의 7.12~7.76%보다 높았습니다.³
반면 별도의 영어 장애음성 연구에서는 432명의 개인별 음성으로 학습한 모델의 중앙값 단어오류율이 4.6%로, 화자 독립 모델의 31%보다 낮았습니다. 참가자 한 명당 최소 300개의 짧은 구문이 학습에 사용됐습니다.⁴
이 결과는 두 가지를 함께 보여줍니다.
첫째, 하나의 범용 모델은 사람에 따라 매우 다른 성능을 보일 수 있습니다.
둘째, 개인의 음성을 충분히 학습하면 오류를 줄일 가능성이 있습니다.
다만 영어의 짧은 구문 연구이므로 한국어 발달장애인의 자연스러운 일상대화에서 같은 결과가 나온다고 단정할 수는 없습니다.

문제를 다시 정의해야 합니다

음성인식 실패를 이렇게 설명할 수 있습니다.
"그 사람의 발음이 잘못됐다"가 아니라 "AI가 그 사람의 음성과 표현방식을 충분히 배우지 못했다."
이 관점은 기술의 목표도 바꿉니다.
모든 발달장애인의 말을 한 번에 번역하는 하나의 모델을 만드는 것보다, 각 사람의 표현을 배우고 사람과 함께 확인하는 기술이 더 현실적인 출발점일 수 있습니다.

현재 음성인식 대응과 남아 있는 한계

•
현재 대응: 더 크고 정교한 범용 STT 사용
•
도움이 되는 점: 일반적인 발화에서는 빠르게 음성을 문자로 변환할 수 있음
•
남아 있는 한계: 개인별 표현과 실제 의미, 상황을 알지 못함
•
현재 대응: 장애음성에 특화된 모델 개발
•
도움이 되는 점: 대상 음성에 맞춘 학습으로 오류를 줄일 가능성이 있음
•
남아 있는 한계: 같은 장애집단 안에서도 개인차가 크고 데이터셋에 따라 성능이 달라짐
•
현재 대응: 가족이 인식 결과를 직접 수정
•
도움이 되는 점: 실제 표현을 더 정확하게 기록할 수 있음
•
남아 있는 한계: 수정 부담이 가족에게 집중되고 새로운 지원인력에게 경험이 전달되지 않을 수 있음

티클톡은 STT의 답을 저장하지 않습니다

티클톡은 개인이 실제로 사용하는 표현과 그 의미를 연결해 기록하는 개인별 의사소통 지원 서비스입니다.
목표는 발달장애인의 말을 자동으로 완벽하게 번역하는 것이 아닙니다. 일반 STT가 만든 문장을 그대로 당사자의 의사로 확정하는 것도 아닙니다.
티클톡은 다음과 같은 정보를 함께 살펴보는 것을 지향합니다.
•
당사자가 실제로 낸 말과 소리
•
STT가 제시한 하나 이상의 인식 후보
•
가족이나 지원인력에게 어떻게 들렸는지
•
표현이 나온 장소와 상황
•
함께 나타난 표정과 몸짓
•
의미를 다시 확인하는 질문과 방법
•
당사자가 확인하거나 거부한 결과
예를 들어 STT가 특정 발화를 "물 주세요"로 인식했더라도 바로 정답으로 저장하지 않습니다.
그때 당사자가 물을 가리켰는지, 선택지를 제시했을 때 어떤 반응을 보였는지, 비슷한 상황에서 같은 표현을 사용했는지를 함께 확인해야 합니다.

개인화는 '한 번의 학습'이 아니라 '함께 알아가는 과정'입니다

개인화 음성인식은 한 사람의 음성을 학습해 오류를 줄이는 기술입니다.
그러나 음성만 많이 모은다고 충분한 것은 아닙니다. 무엇이라고 말했는지, 실제로 무엇을 의미했는지 확인된 자료가 필요합니다.
티클톡은 가족 안에 머물던 다음 정보를 당사자의 동의 아래 정리하고 공유하는 기반이 될 수 있습니다.
•
이 표현은 보통 어떤 뜻인지
•
어떤 상황에서 자주 사용하는지
•
다른 의미일 가능성은 무엇인지
•
어떻게 물어보면 당사자가 확인하기 쉬운지
•
최근 사용사례에 따라 무엇이 달라졌는지
새로운 교사나 활동지원사가 가족처럼 즉시 알아듣게 만드는 것은 어렵습니다.
하지만 아무런 정보 없이 처음부터 다시 시작하지 않도록 도울 수는 있습니다.

기대할 수 있는 변화

직접적 변화

•
STT 오류를 정답으로 확정하는 위험 감소
•
개인별 표현과 상황정보의 축적
•
가족과 지원인력의 확인 과정 기록
•
반복되는 인식 오류의 발견

중간 변화

•
개인화 음성인식에 사용할 수 있는 품질 높은 자료 축적
•
새로운 대화상대자가 표현을 배우는 시간 단축 가능성
•
가족에게 집중된 반복 설명 부담의 분산 가능성
•
당사자의 의사를 다시 확인하는 과정 증가

장기적 기대

•
발달장애인의 음성기술 접근성 향상
•
개인별 차이를 고려하는 음성인식 기술 확산
•
당사자의 표현이 일상의 선택과 서비스 이용에 더 정확하게 반영될 가능성
이러한 변화는 아직 티클톡의 실제 효과로 입증된 것이 아닙니다. 한국어 자연대화를 활용한 파일럿과 당사자 중심의 평가가 필요합니다.

AI가 알아듣지 못해도, 말은 사라지지 않아야 합니다

음성인식이 알아듣지 못한 말은 의미 없는 소리가 아닙니다.
아직 AI가 배우지 못한 말일 수 있습니다. 또는 음성만으로는 알 수 없고 사람과 상황을 함께 살펴봐야 하는 표현일 수 있습니다.
모두에게 맞는 하나의 음성인식보다, 한 사람의 표현을 계속 배우고 확인하는 기술이 더 필요하지 않을까요?
티클톡은 STT를 정답을 만드는 기계가 아니라 한 사람의 표현을 함께 알아가는 도구로 연결하고자 합니다.
•
관련 콘텐츠 보기: 가족은 알아듣는데, 왜 다른 사람은 이해하기 어려울까?
•
의견 또는 경험 공유: 음성인식이 반복해서 놓치는 표현 알려주기
이 콘텐츠는 공개된 연구자료와 Momenta Knowledge Base를 바탕으로 생성형 AI를 활용해 초안을 작성했으며, 모멘타가 출처 대조, 해석 및 최종 편집을 수행했습니다.
Tickle Talk
Subscribe to 'Tickle Talk'
Subscribe to my site to be the first to receive notifications and emails about the latest updates, including new posts.
Join Slashpage and subscribe to 'Tickle Talk'!
Subscribe
👍