스마트폰 수어 AI: Pixel 수어 텍스트 변환과 음성을 넘어선 접근성
Pixel에서 시작된 ASL 영어 텍스트 변환의 현재 범위와 처리 방식, Android 접근성 도구, 안전한 폰 에이전트 설계, FoneClaw의 현재 기능 경계를 설명합니다.
- 현재 Google의 SL2T는 Pixel 11에서 Gboard와 Live Transcribe를 통해 ASL을 영어 텍스트로 바꾸는 입력 기능부터 제공되며, 다른 기기와 수어는 향후 확장 대상이다.
- 수어 번역은 손 모양뿐 아니라 움직임, 공간, 얼굴 표정, 몸의 방향을 함께 해석해야 하므로 음성을 받아쓰는 기술과 구조적으로 다르다.
- 번역된 문장을 실제 Android 작업으로 연결하려면 대상 앱과 도구 선택, 권한, 시각적 확인, 결과 검증, 중지와 복구가 별도의 단계로 필요하다.
- FoneClaw는 현재 수어 인식이나 SL2T 연동을 표방하지 않으며, 텍스트 입력과 사용자가 선택한 화면 맥락, 작업 정책, 승인, 중지, 복구를 중심으로 음성 밖의 접근성을 확장하고 있다.
스마트폰 수어 AI가 현재 할 수 있는 일
AI가 스마트폰에서 수어를 이해할 수 있느냐는 질문에는 이제 제한적이지만 구체적인 답을 할 수 있다. Google DeepMind가 공개한 SL2T는 Pixel 11에서 Gboard와 Live Transcribe에 ASL을 영어 텍스트로 바꾸는 수어 받아쓰기 기능을 제공한다. 사용자가 카메라 앞에서 ASL로 표현하면 결과가 영어 문장으로 나타나므로, 키보드 입력이나 가까운 사람과의 대화에서 텍스트 입력 경로로 활용할 수 있다. 현재 범위의 핵심은 Pixel 11, ASL 입력, 영어 출력이다.
Google DeepMind의 수어 AI 공개 설명은 더 많은 기기와 언어를 향후 과제로 제시한다. 따라서 다른 Pixel 기기나 모든 Android 휴대폰에서 같은 기능을 사용할 수 있다고 확대해서 해석해서는 안 된다. 학습에 여러 수어의 자료가 쓰였다는 사실도 현재 제품이 그 수어들을 모두 번역한다는 뜻은 아니다.
이 이정표가 중요한 이유는 수어를 휴대폰의 실제 입력 방식으로 가져왔기 때문이다. 수어 사용자는 번역된 문장을 메시지 입력란에 넣거나, Live Transcribe에서 청인과 텍스트로 대화를 이어갈 수 있다. 다만 수어가 문장으로 변환됐다는 사실만으로 앱이 선택되거나 메시지가 전송되지는 않는다. SL2T는 언어 입력을 담당하고, Android 작업 실행은 앱 선택과 권한, 확인 절차를 거치는 별도 계층이다.
현재 기능을 평가할 때는 번역 성공 사례와 함께 제한도 확인해야 한다. 카메라 구도, 조명, 손과 얼굴의 가림, 빠른 지문자, 지역과 개인에 따른 표현 차이가 결과에 영향을 줄 수 있다. 중요한 메시지나 일정 변경처럼 결과가 남는 작업에서는 변환된 문장을 먼저 읽고 수정할 수 있어야 한다.
수어 번역이 음성 자막과 다른 이유
수어 AI와 음성 자막은 모두 언어를 텍스트로 보여주지만 입력의 구조가 다르다. 음성 받아쓰기는 시간에 따라 이어지는 소리를 분석한다. 수어 번역은 양손의 모양과 위치, 움직임, 몸의 방향, 얼굴 표정, 시선, 공간적 관계를 동시에 해석해야 한다. 얼굴과 몸의 움직임은 감정만 보태는 장식이 아니라 문법과 의미를 전달할 수 있다.
전 세계에는 200개가 넘는 수어가 있으며 각각 고유한 어휘와 문법을 지닌 자연언어다. ASL은 영어를 손동작으로 치환한 체계가 아니며 한국수어를 비롯한 다른 수어와도 동일하지 않다. 한 수어에서 잘 작동하는 모델이 다른 수어를 자동으로 이해한다고 볼 수 없는 이유가 여기에 있다.
번역 과정 역시 손동작 사전을 순서대로 찾는 작업보다 복잡하다. 수어에서는 여러 정보가 동시에 표현되고, 공간에 배치한 대상을 나중에 다시 가리키며, 문장의 초점이나 시제를 비수지 신호로 나타낼 수 있다. 장갑이나 제한된 제스처 목록만 인식하는 방식은 정해진 명령에는 유용할 수 있지만 자연스러운 수어 대화를 온전히 번역하기 어렵다.
폰 에이전트를 만드는 입장에서 우리가 얻는 교훈은 명확하다. 입력 방식을 추가하는 것만으로 접근성이 완성되지 않는다. 사용자가 사용하는 언어의 구조를 존중하고, 변환 결과를 확인·수정하며, 오류가 생기면 다른 입력으로 전환할 수 있어야 한다. 음성 중심 인터페이스에 카메라 입력을 덧붙이는 수준보다 언어와 작업 전 과정을 다시 설계해야 한다.
SL2T 처리 구조와 정확도·개인정보 경계
SL2T의 처리 경계를 이해하면 기능과 개인정보 선택을 더 정확히 판단할 수 있다. DeepMind의 설명에 따르면 휴대폰에서는 MediaPipe Holistic이 카메라 영상에서 얼굴, 손, 자세의 랜드마크를 추출한다. 이후 원본 영상은 폐기되고, 추출된 기하 좌표가 서버로 전송되어 번역 모델의 입력으로 사용된다. 따라서 랜드마크 추출은 기기에서 이뤄지지만 번역 전체가 기기 안에서 끝나는 구조는 아니다.
모델은 수어를 먼저 단어 목록으로 바꾼 뒤 영어 문장을 조립하는 대신 랜드마크의 연속에서 텍스트를 직접 생성하도록 설계됐다. 학습에는 50개가 넘는 수어에 걸친 10만 시간 이상의 자료가 사용됐다. 이 규모는 다양한 시각 언어 패턴을 학습하는 기반이지만, 현재 사용자에게 제공되는 제품 기능의 범위는 여전히 ASL에서 영어로의 변환이다.
평가 수치도 실제 사용 조건과 함께 읽어야 한다. 벤치마크는 모델 간 개선을 비교하는 데 유용하지만 카메라 위치, 배경, 서명자의 속도와 신체 특성, 일상적인 표현 차이를 모두 대표하지는 않는다. DeepMind가 공개한 예시에서도 드문 수어 표현, 빠른 지문자, 분류사, 피동 구성, 시제 표현에서 오류가 남아 있음을 확인할 수 있다. 이는 실패를 과장할 이유가 아니라 수정 가능한 인터페이스가 필요한 근거다.
개인정보 측면에서는 원본 영상과 랜드마크 좌표를 구분해야 한다. 원본 영상이 폐기된다는 설명은 중요한 보호 조치지만, 좌표 데이터의 처리 목적과 전송, 보관 조건까지 사용자가 이해할 수 있어야 한다. 카메라가 꺼졌을 때, 네트워크가 끊겼을 때, 서버 번역이 지연될 때 어떤 기능이 남는지도 제품 화면에서 분명히 보여줘야 한다.
실전에서는 변환 문장을 실행 명령으로 바로 넘기기보다 중간 확인 상태에 두는 것이 안전하다. 사용자는 텍스트로 내용을 고치거나 카메라 구도를 다시 잡고, 필요하면 키보드 같은 대체 입력 방식으로 전환할 수 있어야 한다. 이 세 가지 복구 경로가 번역 정확도 수치보다 일상적인 신뢰에 더 직접적인 영향을 준다.
휴대폰 작업에 맞는 접근성 입출력 선택
접근 가능한 AI 폰 에이전트는 하나의 입력 방식을 모든 사용자에게 적용하지 않는다. 목표가 문장 입력인지, 대면 대화인지, 통화인지, 화면 조작인지에 따라 적합한 Android 기능이 달라진다. 기기와 지역, 언어에 따라 제공 범위도 다르므로 실제 휴대폰의 접근성 설정에서 지원 여부를 확인해야 한다.
| 하려는 작업 | 적합한 접근성 경로 | 확인할 경계 |
|---|---|---|
| 수어로 문장 입력 | 지원 기기의 SL2T 수어 받아쓰기 | 지원 기기, 수어와 출력 언어, 카메라 구도, 네트워크 |
| 주변 사람의 말을 텍스트로 보기 | Live Transcribe | 말소리와 주변 소리를 화면 텍스트로 바꾸며 수어 번역과는 역할이 다름 |
| 동영상이나 통화의 음성을 자막으로 보기 | Live Caption | 지원 미디어·통화·기기 범위와 언어를 확인 |
| 통화 중 텍스트로 대화 | 실시간 텍스트 통화 | 통신사, 기기와 지역 지원 여부를 확인 |
| 터치 대신 휴대폰 조작 | Switch Access 또는 지원되는 보조 입력 | 선택, 이동, 뒤로 가기, 긴급 중지 경로를 먼저 연습 |
| 작업 결과 인지 | 화면 텍스트, 명확한 상태 표시, 진동 | 소리만으로 성공이나 실패를 전달하지 않도록 구성 |
Android Live Transcribe 사용 안내에 따르면 이 기능은 주변의 말과 소리를 화면 텍스트로 바꾸고, 사용자가 답변을 입력하거나 소리 알림과 기록 설정을 관리할 수 있게 한다. 한편 Android Live Caption 기능 안내는 지원되는 미디어와 통화의 오디오를 자막으로 표시하는 경로를 설명한다. 두 기능 모두 중요한 접근성 도구이지만 수어 입력을 해석하는 SL2T와 같은 기능은 아니다.
화면을 직접 터치하기 어려운 사용자는 Switch Access 같은 비터치 조작을 함께 구성할 수 있다. 시각장애인과 저시력 사용자를 위한 음성·화면 읽기 조합은 요구사항이 또 다르므로 시각장애인을 위한 Android 음성 휴대폰 설정: TalkBack, Voice Access, FoneClaw에서 해당 사용 흐름을 별도로 설명한다.
출력도 입력만큼 중요하다. 확인 요청, 진행 상태, 성공, 거부, 오류를 화면에서 구별할 수 있어야 하며 필요한 경우 진동을 병행해야 한다. 음성 합성만으로 결과를 알리는 인터페이스는 농인 사용자에게 완료 여부를 전달하지 못한다. 사용자는 자신에게 맞는 입력과 출력 조합을 저장하고, 상황에 따라 빠르게 바꿀 수 있어야 한다.
접근 가능한 언어 입력을 안전한 실행으로 연결하기
Android 수어 텍스트 변환으로 ‘민지에게 10분 늦는다고 알려줘’라는 문장이 만들어졌다고 가정해 보자. 아직 실행할 작업은 정해지지 않았다. 연락처의 민지가 누구인지, SMS와 메일 중 어떤 앱을 쓸지, 지금 보내야 하는지 초안만 만들지 결정해야 한다. 번역된 언어 입력은 의도를 전달하지만 실행 권한까지 부여하지 않는다.
안전한 폰 에이전트는 입력 뒤에 대상 확인, 기능 선택, 권한 검사, 작업 미리보기, 사용자 승인, 실행, 결과 검증, 복구를 둔다. 특히 메시지 전송, 전화 걸기, 일정 변경, 파일 공유처럼 다른 사람이나 데이터에 영향을 주는 작업은 수신자와 내용을 읽기 쉬운 화면으로 보여줘야 한다. 잘못 번역된 단어나 대상은 실행 전에 바로 고칠 수 있어야 한다.
확인은 소리에만 의존해서는 안 된다. 버튼의 의미와 현재 선택 상태를 텍스트로 표시하고, 키보드와 스위치 같은 대체 입력으로 승인하거나 취소할 수 있어야 한다. 시간 제한을 둔다면 사용자가 읽고 반응할 시간을 조정할 수 있어야 하며, 무응답을 승인으로 처리해서는 안 된다.
기능 선택과 실행 권한의 차이를 더 깊게 살펴보려면 AI 에이전트 기능 라우팅: AutoAttach, Suggest, Fallback 실전 가이드가 도움이 된다. 라우팅은 요청에 적합한 기능 후보를 찾는 과정이고, 실제 작업은 활성화 상태와 권한, 승인 정책을 별도로 통과한다.
복구는 모델에게 같은 요청을 무한히 반복시키는 방식이 아니다. 번역 오류라면 텍스트를 수정하고, 카메라 문제가 있으면 구도를 다시 잡으며, 네트워크가 끊겼다면 키보드 입력으로 전환한다. 권한이 없으면 해당 설정을 보여주고, 사용자가 허용하지 않으면 초안 저장이나 수동 완료 같은 경로로 작업을 이어간다.
음성을 넘어 FoneClaw의 현재 접근성 살펴보기
먼저 현재 경계를 분명히 밝힌다. FoneClaw는 수어 인식 기능이나 SL2T 연동을 현재 제공한다고 주장하지 않는다. 카메라 앞의 수어를 해석해 명령으로 바꾸는 기능도 FoneClaw의 현재 공개 범위에 포함되지 않는다. 우리는 이 중요한 입력 계층을 이미 구현된 것처럼 설명하지 않으며, 실제로 제공하는 비음성 경로와 작업 제어를 기준으로 제품을 개선하고 있다.
FoneClaw에서는 사용자가 텍스트로 요청할 수 있다. 지원되는 환경에서는 첨부 자료를 직접 선택하거나 현재 화면을 사용자의 명시적인 동작으로 연결해 필요한 맥락을 제공할 수도 있다. 현재 화면을 다루는 구체적인 흐름은 Android 플로팅 AI 어시스턴트 현재 화면: 묻고 확인하고 실행하는 방법에서 확인할 수 있다. 이 경로는 음성 입력이 어려운 상황에서도 사용자가 무엇을 공유할지 정하도록 설계했다.
폰 에이전트를 만들며 우리가 배운 핵심은 언어 이해와 작업 권한을 분리해야 한다는 점이다. FoneClaw가 요청과 맥락에 맞는 기능을 찾더라도 그 매칭 자체가 실행을 승인하지 않는다. 활성화된 도구인지, Android 권한이 있는지, 해당 도구에 어떤 승인 정책이 적용되는지 확인한 뒤 실행 상태로 넘어간다. 사용자는 도구 정책을 조정하고 진행 중인 작업을 확인하거나 중지할 수 있으며, 권한 문제나 실행 실패가 생기면 복구 경로를 따라갈 수 있다.
이 구조는 수어 입력이 언젠가 폰 에이전트와 연결될 때도 그대로 중요하다. 변환 문장을 먼저 보여주고, 대상 앱과 작업을 시각적으로 제시하며, 수정과 취소를 제공해야 한다. 승인 화면과 작업 상태는 자막이나 음성 출력 하나에 묶이지 않고 텍스트와 명확한 상태 변화로 이해할 수 있어야 한다. 도구별 신원과 권한, 기록 설계는 AI 에이전트 신원과 권한: 도구별 승인 제어와 감사 로그 설계에서 더 자세히 다룬다.
앞으로 우리가 개선하려는 방향도 여기서 출발한다. 텍스트 입력의 조작성, 화면 맥락을 선택하는 과정, 승인 상태의 가독성, 중지와 오류 복구를 다양한 입력 장치에서 더 일관되게 만드는 일이다. 접근성을 음성 명령의 부가 기능으로 취급하지 않고, 입력부터 실행 결과까지 이어지는 제어 구조의 품질로 다루고 있다.
농인 사용자와 함께 접근 가능한 폰 에이전트 점검하기
농인 스마트폰 어시스턴트를 설계할 때는 농인 사용자가 요구사항 검토의 마지막 단계에만 참여해서는 충분하지 않다. DeepMind는 개념 수립, 데이터, 평가, 영향 검토 과정에 농인 참여자와 자문 그룹이 관여했다고 설명한다. 실제 사용자가 문제 정의와 우선순위, 실패 기준을 함께 결정해야 기술적으로 정확해 보이는 기능이 생활 속에서 어긋나는 일을 줄일 수 있다.
첫 번째 점검 항목은 언어와 사용자 다양성이다. 어떤 수어와 지역 변이를 지원하는지 명시하고, 연령, 피부색, 신체 특성, 서명 속도, 왼손잡이와 오른손잡이, 한 손으로 수어를 사용하는 상황을 포함해야 한다. 한 명의 테스트 결과를 전체 농인 공동체의 경험으로 일반화할 수 없다.
물리적 사용 조건도 살펴야 한다. 사용자가 한 손으로 휴대폰을 들고 다른 손으로 수어를 할 수 있는지, 기기를 세워 둘 필요가 있는지, 얼굴과 상체가 화면에 들어오는지 확인한다. 카메라 프레임 밖으로 손이 나갔을 때 즉시 알아볼 수 있는 시각적 안내가 있어야 하며, 조명이 부족하거나 배경이 복잡한 상황도 시험해야 한다.
개인정보와 지연 시간은 별도의 평가 축이다. 무엇이 기기에서 처리되고 무엇이 서버로 전송되는지, 원본 영상과 추출 데이터가 각각 어떻게 다뤄지는지 설명해야 한다. 번역이 늦어질 때 진행 상태를 표시하고, 사용자가 카메라 입력을 즉시 중지할 수 있어야 한다.
오류 복구에서는 정답률 하나보다 사용자가 실패를 얼마나 쉽게 발견하고 고칠 수 있는지를 측정한다. 텍스트 기반 수정, 카메라 구도 다시 잡기, 대체 입력 방식으로 전환하기를 모두 제공하고 각각 몇 단계가 필요한지 확인한다. 긴급하거나 민감한 작업에는 미리 정한 연락 방식과 수동 경로를 남겨야 한다.
- 언어 범위: 지원 수어, 지역 변이, 출력 언어를 제품 화면에서 구체적으로 밝힌다.
- 신체와 환경: 왼손·한 손 수어, 다양한 서명자, 조명과 카메라 위치를 실제 기기로 시험한다.
- 데이터 경계: 영상, 랜드마크, 번역 문장이 어디에서 처리되는지 구분한다.
- 작업 확인: 대상, 내용, 권한과 결과를 소리 없이도 검토할 수 있게 한다.
- 오류 수정: 텍스트 수정과 재입력, 중지, 대체 경로를 같은 흐름 안에 둔다.
- 공동 평가: 농인 사용자가 성공 기준과 위험도를 정하고 반복 평가에 참여한다.
음성 없는 휴대폰 작업을 실제로 검증하는 방법
접근 가능한 작업은 먼저 되돌리기 쉬운 사례로 시험한다. 예를 들어 실제 메시지를 보내는 대신 새 메모에 짧은 문장을 입력하는 작업을 고른다. 수어 입력 기능을 사용할 수 있다면 변환된 텍스트가 의도와 맞는지 읽고, 오류가 있으면 직접 수정한다. 지원되지 않는 기기에서는 같은 검증 절차를 키보드 입력으로 진행할 수 있다.
- 카메라나 키보드로 입력한 문장이 실행 전에 화면에 온전히 표시되는지 확인한다.
- 폰 에이전트가 선택한 앱과 작업 대상을 명확한 텍스트로 보여주는지 확인한다.
- 필요한 Android 권한이 무엇인지, 거부했을 때 어떤 대안이 제공되는지 살펴본다.
- 실행 전 수정과 취소가 키보드나 보조 입력으로 가능한지 시험한다.
- 실행 결과가 화면 상태와 진동 등 사용 가능한 방식으로 전달되는지 확인한다.
- 진행 중 중지를 누르고 작업이 실제로 멈췄는지 확인한다.
- 카메라, 네트워크 또는 인식이 실패했을 때 텍스트 입력과 수동 작업으로 전환한다.
한 번의 성공으로 모든 환경의 신뢰성을 판단할 수는 없다. 자주 쓰는 작업마다 낮은 위험의 시험을 거치고, 앱이나 시스템이 업데이트된 뒤에는 입력과 권한, 확인 화면을 다시 살펴야 한다. 음성을 넘어선 접근성은 새로운 입력 모델 하나가 아니라 사용자가 오류를 발견하고 멈추고 다른 길을 선택할 수 있는 전체 작업 흐름에서 완성된다.