Esempi di Agenti AI: Devin, Replit Agent, Lindy e Manus

Riassunto

Non tutti gli agenti IA sono uguali. Devin scrive PR, Replit Agent crea app complete, Lindy automatizza il lavoro amministrativo, Manus fa ricerca generica. Scopri quale scegliere, come scalarli senza bresare il team, e perché il numero che conta davvero è il tasso di merge, non le features della demo.

Scrivania di sviluppatore al tramonto con laptop e monitor che mostrano un editor di codice e una diff di pull request, rappresentando esempi di agenti IA per team di ingegneria

Avete iniziato a sentir parlare di agenti IA ovunque quest'anno, ma la maggior parte delle liste di "esempi di agenti AI" mischia un chatbot per il supporto clienti con uno strumento di coding autonomo come se risolvessero lo stesso problema. Non è così. Per un team di ingegneri, un agente è software che pianifica un compito, lo esegue in un ambiente reale (shell, browser, file system), e torna indietro con un risultato finito, non con un suggerimento su cui dovete ancora agire. Qui sotto troverete quattro agenti davvero costruiti per il lavoro di engineering, che cosa fa bene ciascuno, e dove il modello ha ancora bisogno di un essere umano nel circuito decisionale.

La distinzione conta perché i modi di fallire sono diversi. Un assistente che sbaglia vi spreca il tempo leggendo un suggerimento mediocre. Un agente che sbaglia può aprire una pull request contro il vostro main branch, installare una dipendenza che non avete approvato, o bruciare crediti di "compute" su un task che non aveva nessuna possibilità di finire. Lo scoping conta più della capability.

Noterà che tutti e quattro gli esempi qui sotto vivono in angoli diversi della stessa mappa. Due agiscono direttamente su una codebase (Devin, Replit Agent). Uno agisce sul processo di lavoro attorno al coding senza toccare il codice (Lindy). Uno è un agente general-purpose capace di scrivere codice ma non costruito attorno a un repository (Manus). Scegliere l'angolo sbagliato per il vostro task è la ragione più comune per cui un pilot si blocca.

Devin: Costruito per Spedire PR, Non per Chattare

Devin, di Cognition, gira in una sua sandbox cloud con shell, browser, ed editor. Lei assegna un ticket (migrazione, fix di bug, manutenzione programmata) e l'agente pianifica il lavoro, scrive il codice, fa girare i test, e apre una PR per la review. È scoped strettamente di proposito: niente slide deck, niente ricerca open-ended, solo task di ingegneria con un output di codice.

Cognition riferisce che il tasso di merge delle PR di Devin è salito dal 34% al 67% in un anno, e che Devin adesso scrive l'89% dei suoi stessi commit. È un miglioramento reale, ed è anche un numero che vale la pena leggere con cura: una PR mergiata è passata comunque attraverso un reviewer umano. L'agente non ha rimpiazzato la review, ha cambiato come la review assomiglia a qualcosa, da "hai scritto bene questo" a "il piano dell'agente ha senso per questa codebase".

La parte facile da perdere in una demo: Devin fa più bene su una codebase su cui ha già lavorato. Impara convenzioni e decisioni precedenti nell'arco di più sessioni invece di iniziare da zero ogni volta. Su un repo che non ha mai toccato, aspettatevi che i primi task assomiglino più a un onboarding che a un output istantaneo.

Dove guadagna il suo prezzo è sul volume. Il pitch stesso di Cognition è eseguire tanti Devin in parallelo su una singola grande migrazione, ciascuno prendendo una fetta del lavoro e riportandola indietro con una PR reviewabile, con integrazioni cablate in GitHub, Linear, Slack, e Datadog così il lavoro appare dove il vostro team guarda già. Questo è un use case diverso da "rimpiazzare un ingegnere". È più vicino a "pulire una migrazione di 400 file in una settimana invece che in un trimestre".

A più o meno 500 dollari per seat al mese più usage in cima, Devin è prezzato per team con recurring migration o maintenance work che possono puntare un numero su, non per uno sviluppatore solo che sta testando le acque.

Close-up of hands typing on a mechanical keyboard with a code editor visible on a blurred monitor in the background

Replit Agent: Dal Prompt all'App Deployata, Niente Setup Locale

Replit Agent vive dentro l'IDE browser-based di Replit. Dategli un prompt e scaffolda un'app full-stack intera, cablare un database, scrive e corre il codice, e lo deploya, tutto senza voi che toccate un terminale o configurate l'hosting. È l'agente più veloce di questa lista da "idea" a "qualcosa che un utente può clickare".

Il tradeoff è lo scope. Replit Agent è più forte per app web costruite dentro l'ambiente di Replit stesso. Chiedetegli qualcosa che ha bisogno di una VPC, un deployment on-prem, o un task pesante di ricerca, e siete fuori da quello per cui è stato disegnato, quel territorio è di Manus, non questo. Il pricing è basato su crediti e sforzo, che significa una build complessa può costare più di quello che indovinereste prima che corra.

Il tier gratuito Starter vi dà limitati daily agent credits per testare il flusso di lavoro prima di pagare nulla. Core, a 18-20 dollari al mese, aggiunge usage credits e fino a due parallel agent runs; Pro, a 90-100 dollari al mese, monta quello fino a dieci parallel agents, utile se più di una persona su un piccolo team vuole prototipare nello stesso tempo senza mettersi in coda dietro a l'uno all'altro.

Per un prototipo, uno strumento interno, o una proof of concept che dovete far girare prima di una riunione, questo è l'agente che vi ci arriva senza una conversazione di infrastruttura separata.

Lindy: Che cosa Assomiglia a un Agente Quando Non Tocca il Codice

Non ogni agente legato al engineering scrive codice. Lindy corre recurring admin work: email triage, riunione scheduling, follow-up emails, raggiungibile su iMessage o SMS oltre che come app web. Un engineering manager potrebbe puntarvi incidents follow-ups o richieste di stato ricorrenti invece di code review.

Vale la pena includerlo proprio perché è l'esempio opposto. Lindy non ha nessun concetto di una pull request o una test suite. Automatizza il processo di lavoro attorno all'engineering, non l'engineering stesso. Se il vostro modello mentale di "agente IA" è "qualcosa che tocca il mio repo", Lindy è il reminder che la categoria è più grande, e che l'agente giusto dipende interamente da quale task ricorrente state cercando di togliere dal piatto di una persona.

Il pricing scala con quanto del lavoro ne possiede: Plus inizia a 49,99 dollari al mese per fino a due inboxes e usage standard, Pro a 99,99 aggiunge computer-use automation e una scelta di modello sottostante, e Max a 199,99 copre fino a cinque inboxes. Niente di questo compra code review. Compra indietro i venti minuti che un manager spende ogni mattina triaging quello che è arrivato durante la notte.

Manus: L'Agente General-Purpose, e Dove Si Rompe su un Repo Reale

Manus opera un computer virtuale: un vero browser, terminale, e file system, pianificando multi-step tasks e tornando indietro con file finiti invece di risposte chat. Può ricercare un topic, scrivere un report, e generare un prototipo funzionante in una corsa. Comparato a Devin o Replit Agent, non è scoped all'engineering per niente, che è esattamente la sua forza e il suo limite.

Puntate Manus a una codebase davvero grande, non familiare, e le crepe si mostrano. Non porta la memoria repo-specifica che Devin costruisce su sessioni ripetute, e il suo pricing di task basato su crediti diventa caro in fretta su qualcosa che richiede dozzine di iterazioni contro una test suite reale. Il suo modo Wide Research, che fa un fan-out di un task attraverso tanti sub-agents in parallelo, è genuinamente utile per il lavoro "survey these twelve competitor APIs", meno per "fix this flaky integration test". È meglio trattato come un agente di ricerca e prototipazione che capita di essere capace di scrivere codice, non come un sostituto per un agente di coding costruito attorno ai flussi di PR.

Manus è adesso operato da Meta seguendo l'acquisizione della startup dalla compagnia nel 2026, che è degna di sapere se la residenza dei dati o la stabilità del vendor fattori nella vostra valutazione il modo in cui farebbero per qualche altro tool di engineering.

Silhouette of a developer at a standing desk facing three monitors showing dashboards and a pull request review screen

Che Cosa Costano Quattro Esempi di Agenti, Fianco a Fianco

Le liste di feature fanno questi tool suonare intercambiabili. Il pricing non lo fa:

Il pattern: agenti scoped strettamente a un job (Devin su migrazioni, Lindy su inbox triage) caricano un tasso piatto, prevedibile. Agenti costruiti per task open-ended, di lunghezza variabile (build di Replit Agent, run di ricerca di Manus) caricano su usage, che significa il vostro costo mensile reale dipende da quanto ambiziosi sono i vostri prompt.

Perché l'88% dei Pilot di Agenti Non Arriva Mai in Produzione

Ecco il numero che va accanto a ognuno di questi tool: l'88% dei pilot di agenti non arriva mai in produzione, tra i progetti di agenti enterprise sondati per quel numero, non solo agenti di coding. La maggior parte dei team corre una demo convincente, poi si blocca sulla parte non glamorosa: scoped permissions, un loop di valutazione, e qualcuno il cui job è possedere la cosa quando è sbagliata.

Il consiglio che vedrete dappertutto è "date all'agente accesso ampio così non è costantemente bloccato". Saltatelo. I team i cui pilot effettivamente spediscono danno all'agente narrow write access a un solo repo, un tipo di task, e una merge gate approvata da umano, poi allargano lo scope solo dopo poche settimane di evidenza. L'accesso ampio il primo giorno è come una demo diventa un incident report.

Un pilot che vale la pena di eseguire per un mese assomiglia a qualcosa come questo: un repo, un tipo di task ricorrente (una classe di dependency bump, un pattern di bug specifico), un proprietario nominato che controlla l'output dell'agente ogni giorno per le prime due settimane, e un numero duro che state tracciando, tasso di merge, ore salvate, o time-to-first-PR. Se non potete nominare quel numero prima di iniziare, non state pilotando un agente, state facendo una demo di uno.

Agente vs. Chat: Due Job Diversi sulla Stessa Codebase

Vale la pena di nominare la cosa che nessuno di questi quattro tool fa: rispondere a una domanda sul vostro codice senza agire su di essa. "Dov'è il auth cablato in questo repo" o "che cosa è cambiato nel modulo payments l'ultimo sprint" non è un task che volete un agente eseguire, è una domanda che volete risposto in dieci secondi, con una citazione al file reale.

Questo è un job diverso da spedire una PR o scaffoldare un'app, e confondere i due è dove molte conversazioni di "dovremmo adottare un agente IA" vanno di traverso. Un agente che agisce ha bisogno di permessi scoped, un loop eval, e un piano di rollback. Uno strumento che risponde a domande su una codebase non ha bisogno di nessuno di questi, perché non tocca mai il repo. Sapete quale job state assumendo prima di scegliere uno strumento da questa lista.

Questo è anche perché le due categorie non sono competitor. Un team che corre Devin su migrazioni ha ancora bisogno di un modo veloce di chiedere "perché è stato scelto questo pattern" prima di fidarsi del piano dell'agente su quello successivo. L'agente gestisce l'esecuzione; il layer question-answering gestisce la chiamata di giudizio se l'esecuzione è persino la mossa giusta.

Top-down flat lay of a developer desk with laptop keyboard, notebook, coffee cup, and headphones

Quale di Questi Esempi di Agenti Vale la Pena Pilotare per Primo

Se avete uno specifico, ricorrente task di engineering con una chiara definizione di done (una migrazione di dipendenza, una classe di bug fix, manutenzione programmata), Devin è costruito esattamente per quello, e il prezzo ha senso una volta che potete puntare a ore salvate. Se avete bisogno di un prototipo funzionante oggi e non volete una conversazione di infrastruttura, Replit Agent arriva là più velocemente. Se il bottleneck non è il codice ma il process work attorno a esso, Lindy vale la pena di dare un'occhiata prima di assumere che avete bisogno di un agente di coding.

Saltate Manus per il lavoro di engineering specificamente. È un agente general-purpose davvero capace, solo non uno costruito attorno al vostro repo, alla vostra test suite, o al vostro processo di PR, e questo è lo strumento sbagliato per un task di codebase anche quando la demo assomiglia bene. Pilotate stretto, misurate il tasso di merge o le ore salvate, e solo allora allargate l'accesso.

Domande frequenti

Qual è la differenza principale tra un agente IA e un assistente IA?
Un assistente suggerisce azioni che dovete eseguire voi; un agente esegue azioni autonomamente e riporta il risultato finito. Un assistente sbagliato vi spreca tempo leggendo un suggerimento mediocre. Un agente sbagliato può aprire una PR contro il vostro main branch o installare dipendenze non approvate.
Perché l'88% dei pilot di agenti IA fallisce?
La maggior parte fallisce perché viene data all'agente accesso troppo ampio troppo presto. I team che hanno successo iniziano con uno scope ristretto (un repo, un tipo di task), approvazione umana nel merge gate, e misurano sempre il tasso di merge o le ore salvate.
Quale agente devo usare per scrivere codice in un repository esistente?
Devin se avete recurring migration o maintenance work da misurare in ore. Replit Agent se dovete scaffoldare un'app new-build in poche ore senza configurare infrastruttura. Saltate Manus per il coding su repo reali—è un agente general-purpose, non repository-first.
Devin, Replit Agent, Lindy e Manus risolvono lo stesso problema?
No. Devin scrive PR autonome. Replit Agent crea app complete. Lindy automatizza admin work senza toccare codice. Manus fa ricerca e prototipazione general-purpose. Scegliere il tool sbagliato per il vostro task è il modo più veloce per far fallire un pilot.
Quanto costa Devin al mese?
Circa 500 dollari per seat al mese, più costi aggiuntivi basati sull'usage dei compute units. Non c'è tier gratuito. È prezzato per team con lavoro di migrazione o manutenzione ricorrente misurabile.
Posso provare Replit Agent gratuitamente?
Sì, il tier Starter è gratuito e vi dà crediti giornalieri limitati per testare il workflow. Il tier Core costa 18-20 dollari al mese, Pro 90-100 dollari al mese con dieci parallel agent runs.
Lindy può automatizzare il code review?
No. Lindy è costruito per admin work: triage di inbox, scheduling di riunioni, follow-up email. Non ha concetto di pull request o test suite. Non rimpiazza un agente di coding, rimpiazza il lavoro amministrativo attorno al coding.
Manus è più capace di Devin per il coding?
Manus è più general-purpose, ma non è costruito attorno a repository e workflow di PR. Non porta la memoria repo-specifica di Devin e i costi di credito salgono velocemente su task che richiedono tante iterazioni. Per il coding su repo reali, Devin è lo strumento migliore.
Come posso iniziare un pilot di agente senza rischiare?
Iniziate con uno scope ristretto: un solo repo, un tipo di task ricorrente specifico, una persona che controlla l'output ogni giorno per due settimane, e una metrica dura (merge rate, ore salvate). Non date accesso ampio il primo giorno.