Monté 11 agentes AI por $5 USD/mes

Cómo construí un sistema multi-agente con Anthropic Claude, model routing y self-hosting que cuesta menos que un café — y atiende mi negocio 24/7.


La mayoría de los SaaS de “AI agents” cobran $50-200 USD/mes por agente. Yo necesitaba once para atender mi negocio freelance — uno por área (dev, sales, finance, ops, security, etc.). Hacer el cálculo me iba a costar el alquiler.

La solución fue construir el sistema yo mismo. Llevo 3 meses corriéndolo y la cuenta de Anthropic dice **$5 USD/mes**. Esto es cómo.

El problema

Cuando trabajas freelance, eres todos los departamentos a la vez:

Y por encima de eso, hacer el trabajo real con el cliente. Las primeras semanas todo cabe en tu cabeza. Para el mes seis, dejas leads sin responder y se te pasan facturas.

La arquitectura

Un equipo de 11 agentes especializados, coordinados por un router barato que decide cuál atiende cada mensaje:

Discord (UI)


Router (Claude Haiku 4.5, <300ms)


┌─────┬─────┬───────┬─────────┬────────┬──────────┐
Dev  Sales  Finance Creative  Ops      Security
GitHub CRM   Stripe  LinkedIn  Docker   Logs
Linear Leads invoices Bluesky  proxy    audits

El truco no es el número de agentes — es especialización. Cada uno tiene:

  1. Su propio system prompt (corto, enfocado)
  2. Solo las tools que necesita (5-10, no 50)
  3. Una “complejidad” declarada que elige el modelo

Model routing — el secreto del costo bajo

Cada agente declara qué tan complejo es su trabajo:

TASK_MODELS = {
    "routing":  "claude-haiku-4-5",   # router del bot
    "simple":   "claude-haiku-4-5",   # FAQ, clasificar
    "standard": "claude-sonnet-4-6",  # code review, propuestas
    "complex":  "claude-opus-4-7",    # estrategia, decisiones difíciles
}

Haiku cuesta ~10× menos que Sonnet, que cuesta ~5× menos que Opus. Usar Opus para clasificar mensajes es como pagar consultor senior para mover archivos. Usar Haiku para diseñar arquitectura es como pedirle a un becario una decisión de negocio.

El router (Haiku) decide en milisegundos quién atiende, y el especialista usa el modelo que su tarea justifica. Resultado: el 80% de las llamadas son Haiku.

Prompt caching (ahorro 90%)

Anthropic cachea el system prompt por 1 hora si se lo pides. Cada agente tiene ~3K tokens de instrucciones que no cambian entre llamadas. Con cache:

Con conversaciones frecuentes el ahorro es brutal. Mi cache hit rate ronda el 85%.

Self-hosting (cero costo de infraestructura)

El sistema entero corre en mi homelab (Proxmox + Ubuntu + Docker Compose). El stack:

Cero AWS, cero Vercel, cero “managed”. El servidor está físicamente bajo mi escritorio.

Approval gates — la diferencia entre demo y producción

Cada acción con efecto público pasa por aprobación humana:

El agente prepara la acción y me pregunta. Yo decido. Si me ausento, el agente no se vuelve loco — se queda esperando.

Esto convirtió el proyecto de “demo divertido” a “sistema en el que confío para que hable con clientes”.

Lo que NO funcionó (y aprendí)

La cuenta del mes

Mi último mes de Anthropic:

MétricaValor
Llamadas totales~4,200
Tokens procesados~5.2M
Cache hit rate85%
Costo total$4.87 USD

Cinco dólares por once asistentes corriendo 24/7. Si Lalu duerme, los agentes siguen.

¿Replicable?

Sí. El código está estructurado para que un cliente despliegue su propia instancia con un docker compose up -d. Si te interesa montar algo así para tu negocio — escríbeme a [email protected] o desde la oficina virtual.


Si quieres ver el sistema funcionando, abre oficina.lalu.dev — los stats de arriba a la derecha vienen del mismo bot que cobró este mes esos $4.87.


← todos los posts