Monté 11 agentes AI por $5 USD/mes
Cómo construí un sistema multi-agente con Anthropic Claude, model routing y self-hosting que cuesta menos que un café — y atiende mi negocio 24/7.
La mayoría de los SaaS de “AI agents” cobran $50-200 USD/mes por agente. Yo necesitaba once para atender mi negocio freelance — uno por área (dev, sales, finance, ops, security, etc.). Hacer el cálculo me iba a costar el alquiler.
La solución fue construir el sistema yo mismo. Llevo 3 meses corriéndolo y la cuenta de Anthropic dice **$5 USD/mes**. Esto es cómo.
El problema
Cuando trabajas freelance, eres todos los departamentos a la vez:
- Atender leads y mandar propuestas (sales)
- Generar invoices y cobrar (finance)
- Publicar contenido (creative)
- Code reviews y deploys (dev)
- Monitorear infraestructura (ops)
- Contestar emails y WhatsApp (email)
Y por encima de eso, hacer el trabajo real con el cliente. Las primeras semanas todo cabe en tu cabeza. Para el mes seis, dejas leads sin responder y se te pasan facturas.
La arquitectura
Un equipo de 11 agentes especializados, coordinados por un router barato que decide cuál atiende cada mensaje:
Discord (UI)
│
▼
Router (Claude Haiku 4.5, <300ms)
│
▼
┌─────┬─────┬───────┬─────────┬────────┬──────────┐
Dev Sales Finance Creative Ops Security
GitHub CRM Stripe LinkedIn Docker Logs
Linear Leads invoices Bluesky proxy audits
El truco no es el número de agentes — es especialización. Cada uno tiene:
- Su propio system prompt (corto, enfocado)
- Solo las tools que necesita (5-10, no 50)
- Una “complejidad” declarada que elige el modelo
Model routing — el secreto del costo bajo
Cada agente declara qué tan complejo es su trabajo:
TASK_MODELS = {
"routing": "claude-haiku-4-5", # router del bot
"simple": "claude-haiku-4-5", # FAQ, clasificar
"standard": "claude-sonnet-4-6", # code review, propuestas
"complex": "claude-opus-4-7", # estrategia, decisiones difíciles
}
Haiku cuesta ~10× menos que Sonnet, que cuesta ~5× menos que Opus. Usar Opus para clasificar mensajes es como pagar consultor senior para mover archivos. Usar Haiku para diseñar arquitectura es como pedirle a un becario una decisión de negocio.
El router (Haiku) decide en milisegundos quién atiende, y el especialista usa el modelo que su tarea justifica. Resultado: el 80% de las llamadas son Haiku.
Prompt caching (ahorro 90%)
Anthropic cachea el system prompt por 1 hora si se lo pides. Cada agente tiene ~3K tokens de instrucciones que no cambian entre llamadas. Con cache:
- Llamada 1: paga los 3K tokens completos
- Llamadas 2 a N (dentro de 1h): paga solo 10% de esos 3K
Con conversaciones frecuentes el ahorro es brutal. Mi cache hit rate ronda el 85%.
Self-hosting (cero costo de infraestructura)
El sistema entero corre en mi homelab (Proxmox + Ubuntu + Docker Compose). El stack:
- Postgres 16 — memoria persistente, leads, invoices, logs
- Discord.py — la interfaz (no construyo UI custom, ¿para qué?)
- Cloudflare Tunnel — expone solo lo que necesito, Zero Trust
- aiohttp — webhooks de Stripe/GitHub/Gmail/WhatsApp
Cero AWS, cero Vercel, cero “managed”. El servidor está físicamente bajo mi escritorio.
Approval gates — la diferencia entre demo y producción
Cada acción con efecto público pasa por aprobación humana:
publish_linkedin_post→ ✅/❌ en Discordsend_whatsapp_message→ ✅/❌git_commit_and_push→ ✅/❌write_file→ ✅/❌
El agente prepara la acción y me pregunta. Yo decido. Si me ausento, el agente no se vuelve loco — se queda esperando.
Esto convirtió el proyecto de “demo divertido” a “sistema en el que confío para que hable con clientes”.
Lo que NO funcionó (y aprendí)
- Embeddings comerciales (Voyage, Cohere) costaban $10-20/mes solo por mantener el índice. Cambié a Full-Text Search de Postgres con stemming español — gratis, suficientemente bueno.
- Mega-prompt monolítico — empecé con un solo “super agente” con 50 tools y system prompt de 8K tokens. Era confuso para el modelo y caro. Especialización lo arregló.
- Auto-respuesta sin filtros en WhatsApp — un bot inventó un descuento. Ahora todo outbound público requiere aprobación.
La cuenta del mes
Mi último mes de Anthropic:
| Métrica | Valor |
|---|---|
| Llamadas totales | ~4,200 |
| Tokens procesados | ~5.2M |
| Cache hit rate | 85% |
| Costo total | $4.87 USD |
Cinco dólares por once asistentes corriendo 24/7. Si Lalu duerme, los agentes siguen.
¿Replicable?
Sí. El código está estructurado para que un cliente despliegue su propia instancia con un docker compose up -d. Si te interesa montar algo así para tu negocio — escríbeme a [email protected] o desde la oficina virtual.
Si quieres ver el sistema funcionando, abre oficina.lalu.dev — los stats de arriba a la derecha vienen del mismo bot que cobró este mes esos $4.87.