Contexto
Las comunidades de enseñanza espiritual estudian los libros de Hawkins línea por línea — una cita parafraseada es una cita incorrecta. El RAG estándar (chunk + embed + top-k) falla aquí: la búsqueda semántica devuelve pasajes "suficientemente cercanos", que es exactamente lo que los usuarios no pueden aceptar. Numen se construyó como un producto real: suscripciones por niveles, cuotas y pagos, no una demo.
Arquitectura
Capa de canal (WhatsApp vía Evolution API)
- Texto y voz en ambos sentidos: transcripción con Whisper de entrada, síntesis con ElevenLabs de salida.
- Debouncing de mensajes: los mensajes consecutivos rápidos se acumulan en Postgres y se combinan antes de procesarse — el bot responde a la persona, no a cada fragmento.
- Nodo de guardrails en el camino de respuesta.
Capa de producto
- Planes de suscripción (free / basic / standard / premium) con cuotas por nivel, reinicios diarios, notificaciones de límite y enlaces de pago dentro del chat.
- Sub-workflows de asistente por nivel: el plan premium recibe el pipeline más profundo.
Motor de retrieval (el núcleo)
- Clasificador de consultas que enruta cada pregunta a un handler especializado (simple / compleja / meditación / práctica) con su propio prompt y modelo.
- Expansión multi-query: un LLM dispatcher divide las preguntas complejas en sub-consultas procesadas en paralelo.
- Retrieval híbrido: coincidencia exacta de términos en SQL + semántica (pgvector) en una sola consulta — la coincidencia exacta gana donde importa la redacción, la semántica cubre los conceptos.
- Reranking en dos etapas con una capa de decisión que arbitra entre rankers, produciendo un paquete de evidencia para el agente que responde.
- Detector de vacíos: identifica cuándo la evidencia recuperada no cubre la pregunta y propone qué falta en lugar de alucinar.
Bucle de autoaprendizaje (el 50% → 90%)
- Cada consulta respondida pasa por una puerta de "¿debería aprender de esto?"; los patrones aprendidos se convierten en embeddings y se almacenan, y una capa estratégica ajusta el comportamiento de retrieval con el tiempo.
- Cada interacción se registra para revisión offline — la precisión se midió e iteró, no se asumió.
Capa de conversación
- 9+ agentes especializados: router de intención, formulador RAG, ejecutor RAG, gestor de citas, gestor de insistencia, gestor de reintroducción, ritmo conversacional, analizador de mensajes, agente de FAQ.
- Memoria: Redis para el contexto de conversación en vivo, Postgres para el histórico duradero.
Enrutamiento multi-modelo consciente del coste
- Modelos rápidos y baratos (Gemini flash-lite, niveles GPT mini/nano) para clasificación, enrutamiento y formateo; modelos más potentes solo donde la calidad de la respuesta lo justifica.
Resultados
| Métrica | Valor |
|---|---|
| Precisión de respuesta (eval interna) | ~50% → ~90% |
| Corpus | 6-7 libros, ~2.000 páginas, enriquecido con metadatos por capítulo/tema |
| Orquestación | ~200 nodos, 3 workflows, 9+ agentes |
| Modalidades | Texto + voz (STT/TTS), niveles monetizados |
| Volumen | ~70 mensajes/mes, grupo privado de usuarios |
Stack
n8n · Supabase (Postgres + pgvector) · Redis · Evolution API (WhatsApp) · OpenAI (Whisper, GPT mini/nano) · Gemini (flash-lite) · ElevenLabs · API de reranker