에이전트가 기능을 구현하고 테스트까지 추가한 뒤 PR을 올립니다. 개발자는 코드를 한 줄씩 쓰는 시간보다 요구사항을 설명하고 결과를 확인하는 데 시간을 씁니다. Gergely Orosz의 원문 은 2026년 1월, 이런 작업 방식이 확산되면 소프트웨어 엔지니어링에 무엇이 남는지 묻습니다. 한국어 번역 도 볼 수 있습니다.

이미 달라진 작업과 아직 가정인 미래

원문은 구글의 Jaana Dogan이 분산 에이전트 오케스트레이터의 초안을 Claude Code로 한 시간 만에 만들었다는 사례, Vercel의 Malte Ubl이 AI로 오픈소스 프로젝트 두 개를 진행한 사례를 소개합니다. 둘 다 도구의 능력을 보여주지만, 모든 팀에서 같은 결과가 난다는 뜻은 아닙니다. Dogan은 생성물을 계속 수정 중이라고 했고, Ubl도 어려운 작업에는 감독이 필요하다고 말했습니다.

저자가 말하는 ‘코드의 90% 이상을 AI가 작성’ 역시 업계 전체의 측정값이 아닙니다. 자신이 쓰는 TypeScript·React·Postgres 등의 작업에서는 가능하다고 느꼈고, 이를 여러 팀으로 확장해 생각해 본 전망이자 가정입니다. 테스트가 갖춰진 새 프로젝트나 시행착오 비용이 낮은 스타트업에서 먼저 나타날 수 있지만, 오래된 코드베이스와 위험이 큰 시스템에는 그대로 적용하기 어렵다고 선을 긋습니다.

코드를 덜 써도 엔지니어링은 줄지 않습니다

프로토타입 제작, 언어별 문법 숙련, 범위가 명확한 티켓 구현, 리팩터링의 일부는 AI에 맡기기 쉬워집니다. 제품 담당자나 디자이너도 직접 시제품을 만들어 아이디어를 시험할 수 있습니다. 그만큼 개발자가 단순 구현만으로 제공하던 가치는 줄어듭니다.

남는 일은 무엇을 만들지와 어떻게 작동해야 하는지를 정하는 것입니다. 사용자 요구뿐 아니라 성능, 접근성, 신뢰성, 보안처럼 기능 목록에 잘 드러나지 않는 조건도 명시해야 합니다. 시스템 경계와 의존성, 테스트 방법을 정하지 않은 채 생성량만 늘리면 유지보수할 코드는 빠르게 쌓입니다.

검증은 에이전트 작업의 마지막 단계가 아니라 반복 작업의 일부입니다. 컴파일, 정적 분석, 자동화 테스트로 빠르게 오류를 되돌려주고, 새 기능의 테스트가 실제 요구사항을 확인하는지도 사람이 살핍니다. 배포 후에는 관측 지표로 실제 동작을 확인해야 합니다. 원문이 인용한 Atlassian의 2025년 개발자 경험 조사에서는 응답자 3,500명의 평균 코딩 시간이 업무 주간의 16%였습니다. 코드 작성 시간이 줄어도 나머지 설계·협업·운영 업무가 자동으로 사라지지 않는다는 점을 보여줍니다.

생산량이 늘수록 책임의 위치가 선명해집니다

AI가 더 많은 PR을 만들면 리뷰와 테스트 체계가 감당해야 할 변경도 늘어납니다. 원문은 버그, 보안 문제, 기술 부채가 더 빨리 쌓일 수 있다고 봅니다. 자동화 테스트나 운영 관측이 약한 팀은 그 영향을 더 빨리 겪을 수 있습니다. ‘AI가 작성했다’는 설명만으로 배포된 코드의 책임을 넘길 수는 없습니다.

주니어 개발자에게도 변화가 있습니다. 작업을 작게 나누고, 결과를 검증하고, 설계 판단을 설명하는 역량이 일찍 요구될 수 있습니다. 반면 직접 코드를 작성하며 오류를 고치고 선배에게 배우던 경로가 짧아지면, 그 역량을 어디서 익힐지 새로 설계해야 합니다. 원문은 원격 에이전트와 모바일 작업이 늘 때 업무와 개인 시간의 경계가 흐려질 가능성도 짚습니다.

제품 담당자는 시제품을 더 쉽게 만들고, 엔지니어는 고객 문제를 더 가까이서 다룰 수 있습니다. 두 역할의 업무는 일부 겹치겠지만 구현 가능성을 확인하는 시제품과 안정적으로 운영할 제품 사이에는 여전히 큰 차이가 있습니다. AI가 작성한 코드가 많아질수록 그 차이를 설명하고 검증할 사람이 더 필요합니다.

요약

  • ‘AI가 코드의 90% 이상을 작성한다’는 저자의 작업 경험을 확장한 전망이며, 모든 팀의 현황을 뜻하지는 않습니다.
  • 구현 속도가 빨라질수록 요구사항, 시스템 경계, 테스트, 운영 관측을 설계하는 역량이 중요해집니다.
  • 생성된 코드의 검증과 배포 후 책임은 엔지니어에게 남습니다. 제품 담당자와 개발자의 일은 일부 겹치지만 시제품과 운영 제품의 기준은 다릅니다.