AI 에이전트 예시: 엔지니어링팀이 실제로 쓰는 네 가지
요약
AI 에이전트 네 가지를 비교합니다. Devin은 PR 배포용, Replit Agent는 프로토타이핑용, Lindy는 관리 업무용, Manus는 범용입니다. 88% 파일럿이 프로덕션에 못 간 이유와 성공 조건.
올해 많이 들었을 단어지만, 대부분의 "AI 에이전트 예시" 목록은 고객 지원 챗봇과 자율 코딩 도구를 마치 같은 문제를 푸는 것처럼 섞어놓습니다. 그렇지 않습니다. 엔지니어링팀 입장에서 에이전트는 작업을 계획하고, 실제 환경(셸, 브라우저, 파일 시스템)에서 실행한 후, 아직도 인간이 조치해야 하는 제안이 아닌 완성된 결과를 보고하는 소프트웨어입니다.
이 구분이 중요한 이유는 실패 방식이 다르기 때문입니다. 잘못된 제안을 주는 어시스턴트는 당신의 시간을 낭비합니다. 잘못된 판단을 하는 에이전트는 메인 브랜치에 풀 리퀘스트를 열고, 승인하지 않은 의존성을 설치하거나, 절대 끝나지 않을 작업에 계산 예산을 소진할 수 있습니다. 능력보다는 범위 설정이 중요합니다.
아래 네 가지 예시 모두 같은 지도의 다른 구석에 있습니다. 둘은 코드베이스에 직접 작용합니다(Devin, Replit Agent). 하나는 코드를 건드리지 않으면서 엔지니어링 주변 업무에 작용합니다(Lindy). 하나는 코드를 쓸 수 있지만 저장소를 중심으로 설계되지 않은 범용 에이전트입니다(Manus). 작업에 맞지 않는 구석을 선택하는 것이 파일럿이 멈추는 가장 흔한 이유입니다.
Devin: 채팅이 아닌 PR 배포를 위해 설계된 에이전트
Cognition의 Devin은 자체 클라우드 샌드박스에서 작동하며 셸, 브라우저, 에디터를 갖추고 있습니다. 티켓(마이그레이션, 버그 수정, 정기 유지보수)을 할당하면 작업을 계획하고, 코드를 작성하고, 테스트를 실행한 후 리뷰를 위한 PR을 엽니다. 범위가 좁게 설정되어 있습니다: 슬라이드 덱 없이, 오픈 엔디드 리서치 없이, 코드 출력이 있는 엔지니어링 작업만.
Cognition은 Devin의 PR 병합률이 1년에 걸쳐 34%에서 67%로 상승했으며, Devin이 이제 자신의 커밋의 89%를 작성한다고 보고합니다. 이것은 실질적인 개선이며, 주의 깊게 읽을 가치가 있는 숫자입니다: 병합된 PR은 여전히 인간 리뷰어를 통과했습니다. 에이전트가 리뷰를 대체하지 않았고, 리뷰가 "이것을 올바르게 작성했는가"에서 "에이전트의 계획이 이 코드베이스에 맞는가"로 변경되었습니다.
데모에서 놓치기 쉬운 부분: Devin은 이전에 작업한 코드베이스에서 더 잘 작동합니다. 매번 새로 시작하는 대신 반복된 세션에서 규칙과 이전 결정을 학습합니다. 처음 건드린 저장소에서는 처음 몇 가지 작업이 즉시 결과보다는 온보딩 기간처럼 보일 것으로 예상하세요.
가격표를 정당화하는 부분은 규모입니다. Cognition 자체의 제안은 단일 대규모 마이그레이션에서 많은 Devin을 병렬로 실행하는 것입니다. 각각 작업의 한 부분을 수행하고 검토 가능한 PR로 보고하며, GitHub, Linear, Slack, Datadog에 통합되어 있어 팀이 이미 보는 곳에 작업이 표시됩니다. 이는 "한 명의 엔지니어를 대체"하는 것과는 다른 사용 사례입니다. 이는 "400개 파일 마이그레이션을 분기 대신 일주일에 완료"에 더 가깝습니다.
대략 월 $500의 좌석당 가격에 상단에 사용량을 더하면, Devin은 개발자 한 명이 물을 테스트하는 팀이 아닌, 할당할 수 있는 반복 마이그레이션 또는 유지보수 작업이 있는 팀에 가격이 책정됩니다.

Replit Agent: 프롬프트에서 배포된 앱까지, 로컬 설정 없음
Replit Agent는 브라우저 기반 Replit IDE 내부에 있습니다. 프롬프트를 주면 풀 스택 앱을 스캐폴드하고, 데이터베이스를 연결하고, 코드를 작성하고 실행한 후, 터미널이나 호스팅 구성을 건드리지 않고도 배포합니다. "아이디어"에서 "사용자가 클릭할 수 있는 무언가"로 가장 빠른 에이전트입니다.
트레이드오프는 범위입니다. Replit Agent는 Replit 자체 환경 내에서 만들어진 웹 앱에서 가장 강합니다. VPC, 온프레미스 배포 또는 파일 집약적인 리서치 작업이 필요한 것을 요청하면 설계된 범위를 벗어납니다. 그것은 Manus 영역이지, 이것이 아닙니다. 가격은 크레딧 기반이고 노력 기반입니다. 즉, 복잡한 빌드가 실행되기 전에 예상한 것보다 비용이 들 수 있습니다.
무료 Starter 계층은 매일 제한된 에이전트 크레딧을 제공하여 아무것도 지불하기 전에 워크플로우를 테스트할 수 있습니다. Core는 월 $18~$20이며 사용 크레딧과 최대 두 개의 병렬 에이전트 실행을 추가합니다. Pro는 월 $90~$100이며, 최대 10개의 병렬 에이전트로 증가하여, 소규모 팀의 여러 사람이 서로 대기하지 않고 동시에 프로토타입을 만들 수 있을 때 유용합니다.
프로토타입, 내부 도구 또는 회의 전에 실행해야 하는 개념 증명을 위해, 이것은 별도의 인프라 대화 없이 그곳에 도달하는 에이전트입니다.
Lindy: 코드를 건드리지 않는 에이전트가 보이는 모습
모든 엔지니어링 인접 에이전트가 코드를 작성하는 것은 아닙니다. Lindy는 반복 관리 업무를 실행합니다: 받은편지함 분류, 회의 예약, 후속 이메일, iMessage나 SMS뿐만 아니라 웹 앱으로도 접근 가능합니다. 엔지니어링 매니저는 코드 리뷰가 아닌 사건 후속 조치 또는 반복 상태 요청을 하도록 지정할 수 있습니다.
정확히 반대 종류의 예시이기 때문에 포함할 가치가 있습니다. Lindy는 풀 리퀘스트나 테스트 스위트 개념이 없습니다. 엔지니어링 자체가 아닌 엔지니어링 주변 프로세스 작업을 자동화합니다. 당신의 "AI 에이전트" 정신 모델이 "내 저장소를 건드리는 무언가"라면, Lindy는 카테고리가 더 크며, 올바른 에이전트는 제거하려는 반복 작업에 전적으로 달려 있다는 알림입니다.
가격은 소유량에 따라 변합니다: Plus는 월 $49.99부터 최대 2개 받은편지함과 표준 사용량, Pro는 월 $99.99로 컴퓨터 사용 자동화와 기본 모델 선택 추가, Max는 월 $199.99로 최대 5개 받은편지함을 포함합니다. 그 어느 것도 코드 리뷰를 구매하지 않습니다. 매니저가 매일 아침 하룻밤 사이에 도착한 것을 분류하는 데 쓰는 20분을 되돌립니다.
Manus: 범용 에이전트, 그리고 실제 저장소에서 깨지는 지점
Manus는 가상 컴퓨터를 작동합니다: 실제 브라우저, 터미널, 파일 시스템, 다단계 작업을 계획하고 채팅 답변이 아닌 완성된 파일을 반환합니다. 한 번의 실행으로 주제를 조사하고, 보고서를 작성하고, 작동하는 프로토타입을 생성할 수 있습니다. Devin이나 Replit Agent와 비교하면, 엔지니어링을 위해 범위가 지정되지 않습니다. 이는 정확히 그 장점과 한계입니다.
진정으로 크고 낯선 코드베이스에 Manus를 가리키면 균열이 보입니다. Devin이 반복된 세션에서 구축하는 저장소 특정 메모리가 없으며, 크레딧 기반 작업 가격은 실제 테스트 스위트에 대한 수십 번의 반복이 필요한 모든 것에 빠르게 비싸집니다. "이 12개의 경쟁사 API 조사"는 "이 불안정한 통합 테스트 수정"보다 진정으로 유용한 Wide Research 모드입니다. 코딩할 수 있는 것이 나타나는 리서치 및 프로토타이핑 에이전트로 처리하는 것이 좋으며, PR 워크플로우 중심의 코딩 에이전트 대체로 처리하지 않습니다.
Manus는 이제 회사의 2026년 스타트업 인수 후 Meta가 운영하고 있으며, 데이터 상주권 또는 공급업체 안정성이 다른 엔지니어링 도구처럼 평가에 영향을 미치는 경우 알 가치가 있습니다.

네 가지 에이전트 예시 가격 나란히
기능 목록은 이 도구들이 상호 교환 가능하게 들립니다. 가격 책정은 그렇지 않습니다:
Devin: 월 약 $500 좌석당, 상단에 사용량 기반 계산 단위. 무료 계층 없음. 반복 마이그레이션 또는 유지보수 작업이 있는 팀을 위해 가격이 책정됩니다.
Replit Agent: 월 $18~$20의 무료 Starter 계층 제한 일일 크레딧 포함; Core; Pro는 월 $90~$100로 최대 10개 병렬 에이전트 실행 가능.
Lindy: Plus 월 $49.99, Pro 월 $99.99, Max 월 $199.99, 받은편지함 개수와 자동화 깊이로 확장.
Manus: 크레딧 기반 계층(계획에 따라 월 약 4,000~40,000 크레딧), 정확한 달러 가격은 자체 가격 페이지의 라이브 카운터로만 표시되며 미리 공개되지 않음.
패턴: 한 가지 일에 범위가 좁은 에이전트(마이그레이션에서 Devin, 받은편지함 분류에 Lindy)는 고정 예측 가능한 요금을 청구합니다. 오픈 엔디드, 가변 길이 작업을 위해 구축된 에이전트(Replit Agent의 빌드, Manus의 리서치 실행)는 사용량으로 청구합니다. 즉, 실제 월간 비용은 프롬프트의 야심이 얼마나 큰지에 달려 있습니다.
왜 88%의 에이전트 파일럿은 프로덕션에 도달하지 못하는가
이 숫자는 이 도구들 옆에 있어야 합니다: 88%의 에이전트 파일럿은 프로덕션에 도달하지 못합니다. 코딩 에이전트뿐만 아니라 해당 그림을 위해 조사된 엔터프라이즈 에이전트 프로젝트 전체에서. 대부분의 팀이 설득력 있는 데모를 실행한 후, 재미없는 부분에 멈춥니다: 범위가 지정된 권한, 평가 루프, 잘못되었을 때 소유할 사람.
어디서나 볼 수 있는 조언은 "에이전트를 계속 차단되지 않도록 광범위한 액세스를 제공"합니다. 건너뜁니다. 파일럿이 실제로 배포되는 팀은 에이전트에 한 저장소, 한 유형의 작업, 인간 승인 병합 게이트에 대한 좁은 쓰기 액세스를 제공한 후, 몇 주간의 증거 이후에만 범위를 확장합니다. 1일차 광범위한 액세스는 데모가 사건 보고서가 되는 방식입니다.
한 달을 위한 가치 있는 파일럿은 다음과 같은 것 같습니다: 한 저장소, 한 반복 작업 유형(종속성 범프 클래스, 특정 버그 패턴), 처음 2주 동안 매일 에이전트 출력을 확인하는 명명된 소유자, 추적 중인 하드 숫자, 병합률, 절약된 시간 또는 첫 PR까지의 시간. 시작하기 전에 해당 숫자의 이름을 지을 수 없다면, 에이전트를 파일럿하지 않습니다. 데모를 하는 것입니다.
에이전트 대 채팅: 동일 코드베이스의 두 가지 다른 작업
이 네 도구 중 어느 것도 하지 않는 것을 명명할 가치가 있습니다: 작용하지 않고 코드에 대한 질문에 답변합니다. "이 저장소의 인증이 어디에 연결되어 있는가" 또는 "지난 스프린트의 결제 모듈에서 무엇이 변경되었는가"는 에이전트가 실행하기를 원하는 작업이 아니라, 10초 내에 실제 파일 인용과 함께 답변하기를 원하는 질문입니다.
PR 배포 또는 앱 스캐폴드와는 다른 작업이며, 이 두 가지를 혼동하는 것이 "AI 에이전트를 채택해야 하는가"라는 많은 대화가 엉망이 되는 곳입니다. 행동하는 에이전트는 범위가 지정된 권한, 평가 루프, 롤백 계획이 필요합니다. 코드베이스에 대한 질문에 답변하는 도구는 저장소에 절대 건드리지 않기 때문에 아무것도 필요하지 않습니다. 이 목록에서 도구를 선택하기 전에 어떤 작업을 위해 고용하는지 알아두세요.
이것은 또한 두 카테고리가 경쟁자가 아닌 이유입니다. 마이그레이션에서 Devin을 실행하는 팀은 여전히 "왜 이 패턴이 선택되었는가"를 다음 것에 대한 에이전트의 계획을 신뢰하기 전에 물어볼 빠른 방법이 필요합니다. 에이전트가 실행을 처리합니다. 질문 답변 계층이 실행이 올바른 움직임인지 판단합니다.

이 에이전트 예시 중 먼저 시작할 가치가 있는 것
완료된 명확한 정의가 있는 구체적이고 반복되는 엔지니어링 작업(마이그레이션, 버그 수정 클래스, 정기 유지보수)이 있다면, Devin은 정확히 그것을 위해 만들어졌으며, 절약된 시간을 가리킬 수 있으면 가격이 합리적입니다. 오늘 작동하는 프로토타입이 필요하고 인프라 대화를 원하지 않는다면, Replit Agent가 가장 빠르게 도달합니다. 병목이 코드가 아니라 프로세스 작업이라면, 코딩 에이전트가 필요하다고 가정하기 전에 Lindy를 살펴봅시다.
엔지니어링 작업의 경우 Manus를 건너뜁니다. 진정으로 능력 있는 범용 에이전트이지, 저장소, 테스트 스위트, PR 프로세스 주변에 만들어지지 않았으며, 데모가 좋아 보일 때도 코드베이스 작업에 잘못된 도구입니다. 좁게 파일럿하고, 병합률 또는 절약된 시간을 측정한 후, 그 다음에만 액세스를 확장합니다.