Inborn
KO
Inborn 받기

AI가 내 기기에서 돌아야 하는 이유

모델을 내 기기에서 돌리면 질문이 전송되지 않고, 누구에게도 보관되지 않고, 읽어본 적 없는 정책 변경의 대상이 되지 않고, 내가 일으키지도 않은 유출 속에 남지도 않아요. 그 대가는 모델 크기예요. 휴대폰 메모리에 들어가는 모델은 데이터센터에 사는 모델보다 어려운 추론, 긴 코드, 최신 사실에 약하죠. 사람들이 챗봇에 실제로 입력하는 것 대부분에서는 그 맞바꿈이 남는 장사예요.

클라우드에서 질문에 생기는 일

클라우드 어시스턴트에 입력하면, 무엇을 생각하기도 전에 그 글이 내 기기를 떠나요. 내가 통제하지 않는 서버로 가서 거기서 처리되고, 보통은 바뀔 수 있는 정책에 따라 일정 기간 보관돼요. 그 보관 자체가 음험한 건 아니에요. 그저 내 말이 존재하는 장소가 하나 더 생기는 것이고, 그 장소는 남의 것이며, 그쪽 규정에 따라 직원이 볼 수 있고, 법원이 자기 규정에 따라 볼 수 있고, 침입한 공격자도 볼 수 있어요.

고객 사건을 정리하는 변호사, 사례 요약을 쓰는 임상의, 이름을 확인하는 기자, 그리고 절반쯤 쓰다가 보내지 않고 지워본 적 있는 누구에게도 이건 추상적인 이야기가 아니에요. 더 흥미로운 부분은 평범한 사용자도 그걸 프라이버시라고 부르지 않으면서 똑같이 한다는 거예요. 사람들은 클라우드 어시스턴트 앞에서 끊임없이 스스로 검열하고, 그래서 더 나쁜 답을 받아요.

대신 얻는 것

첫째, 질문이 더는 전송이 아니게 돼요. 내 디스크 말고는 어디에도 사본이 없으니 보관할 것도, 소환할 것도, 유출될 것도 없어요. 둘째는 가용성이에요. 기기 위의 모델은 신호, 로밍, 캡티브 포털, 요청 제한, 장애를 신경 쓰지 않아서 터널 안에서도 비행기 안에서도 책상에서와 똑같이 답해요. 셋째로 요금 계기가 멈춰요. 내 칩에서 하는 추론은 한계 비용이 없고, 그래서 Inborn이 메시지 할당량이 붙은 구독 대신 1회 구매일 수 있어요.

무엇을 내주는가

로컬 AI 마케팅이 대개 조용해지는 대목이니 숫자를 적을게요. 4비트로 양자화한 2B 파라미터 모델은 1.28 GB를 차지하고 2018년 Android 플래그십에서 초당 약 5~6토큰으로 돌아가요. 요즘 기기라면 훨씬 빠르고요. 최상위 클라우드 모델은 그보다 100배에서 1000배 크죠. 그 격차는 예상되는 곳에서 그대로 드러나요. 여러 단계 추론, 긴 코드, 수학, 잘 알려지지 않은 사실, 학습 데이터가 적은 언어에서요. 반면 사람들이 가장 많이 하는 일에서는 훨씬 덜 드러나요. 이메일 다시 쓰기, 페이지 요약, 용어 설명, 한 문단 번역, 개요 잡기, 메모를 글로 바꾸기 같은 것들이죠.

클라우드 어시스턴트가 저장한다고 스스로 밝힌 내용은 그들의 표현 그대로, Inborn이 저장하는 것과 나란히 Inborn vs ChatGPT, Gemini, Claude에 정리돼 있어요. 그래서 솔직한 규칙은 로컬이 더 낫다는 게 아니에요. 사적인 것, 오프라인인 것, 일상적인 것에는 로컬이 낫고, 어려운 끝자락에는 클라우드가 낫다는 거예요. 지금 하는 일이 어느 쪽인지 아는 것이 요령의 전부고요.

Inborn은 어떻게 하는가

Inborn은 앱 안에 0.8B 모델 533 MB를 담아서, 어떤 다운로드가 끝나기 전에 첫 채팅이 돼요. 기기를 프로파일링해서 더 큰 모델에서 기대할 속도를 설치한 뒤가 아니라 설치하기 전에 알려주고요. 지금 돌아가는 모델이 잘하지 못하는 질문이면 아는 척하는 대신 그렇다고 말하고, 더 잘할 모델을 권해요.

검증 쪽도 엔지니어링만큼 중요해요. Android 출시 빌드는 INTERNET 권한을 선언하지 않아서 운영체제가 소켓을 열게 두지 않아요. iPhone에서는 앱 개인정보 보호 리포트 칸이 비어 있고요. 위 문단을 믿을 필요는 없어요. 앱 바깥에서 1분이면 확인할 수 있고, 다음 글이 그 방법의 목록이에요.

다음온디바이스 AI 모델 고르는 법 · 직접 확인하세요