LLM을 사용할 때 원하는 결과를 얻으려면 구체적인 맥락이 필요합니다. 하지만 매번 상세한 배경을 키보드로 입력하는 일은 꽤 번거롭습니다. 안드레 카파시(Andrej Karpathy)는 이 문제를 해결하기 위해 음성 녹음 을 활용한 독특한 방식을 제안합니다.

10분간의 무질서한 음성 녹음

카파시는 LLM 과 협업할 때 음성 기능 을 켜고 10분 동안 아무 생각이나 쏟아내는 방식을 애용합니다. 정돈되지 않은 의식의 흐름 을 그대로 내뱉는 세션입니다. 꽤 유용합니다. 키보드 타이핑이 귀찮을 때 의자에 기대어 말로 설명하는 방식입니다. 때로는 음성 인식 기능을 쓴다고 미리 밝히거나 혼잣말하듯 문답을 주고받기도 합니다.

엉킨 실타래를 푸는 LLM의 능력

LLM은 사용자가 횡설수설하는 긴 음성 텍스트에서 의도를 정확하게 포착합니다. 원래 생각보다 훨씬 깔끔하게 정리된 답변 을 돌려줍니다. 차이가 큽니다. 모델과 싱크를 맞추어 이후 불필요한 수정을 반복하는 과정을 줄여줍니다.

완벽한 텍스트보다 풍부한 데이터

사용자가 정교한 프롬프트 를 작성하려고 애쓸 필요는 없습니다. LLM에게는 정제된 문장보다 더 많은 정보 조각이 담긴 원시 데이터가 필요합니다. 중요합니다. 음성 녹음은 텍스트 입력보다 단위 시간당 훨씬 더 많은 정보 조각 을 전달하므로 모델의 이해도를 높이는 지름길이 됩니다.

오늘 작업부터 키보드 대신 마이크 버튼을 누르고 생각을 쏟아내 보는 방식을 추천합니다. 생각보다 훨씬 정확하게 맥락을 파악하고 받아 적어 줍니다.

요약

  • LLM은 사용자의 정제되지 않은 횡설수설 속에서도 핵심 의도와 맥락을 정확하게 재구성하는 능력이 뛰어납니다.
  • 완벽한 프롬프트 엔지니어링보다 음성 입력을 통한 다량의 정보(context bits) 제공이 모델과의 싱크를 맞추는 데 효과적입니다.
  • 키보드 타이핑의 번거로움을 음성 받아쓰기로 대체함으로써 LLM과의 협업 진입 장벽을 낮추고 작업 효율을 높일 수 있습니다.