← Artículos

Cómo construir tu propio JARVIS con IA en 9 pasos

· 7 min de lectura

Para construir tu propio JARVIS con IA necesitas cinco capas: una máquina que no se apague, un modelo, un harness como Hermes Agent que le dé manos, canales para hablarle y una interfaz. Se monta en nueve pasos: casa, cerebro, harness, identidad, herramientas, memoria, skills, canales con voz e interfaz. Antes de conectar nada, pon un tope de gasto en cada API.

Un JARVIS de verdad no es un chat con voz bonita. Un chat responde; un JARVIS hace. Y esa diferencia no la da una aplicación que descargas: la dan piezas que encajan en un orden. En el video de arriba las monto una por una. Aquí tienes la versión para leer con calma, con lo que comprobé en la documentación oficial de Hermes Agent y dos detalles que no cupieron en el video.

Las cinco capas antes de los nueve pasos

  • Una casa: una máquina que no se apaga.
  • Un cerebro: el modelo que piensa.
  • Un harness: lo que le da manos a ese cerebro. Ejecuta comandos, usa herramientas y trabaja sin que lo mires.
  • Canales: por dónde le hablas.
  • Una cara: la interfaz.

La interfaz, lo que todo el mundo quiere presumir, es lo último y lo menos importante. Yo armé mi propio centro de mando el 1 de agosto sobre Claude Code y la lección fue esa: el JARVIS real es el sistema que corre debajo.

Este sistema es el que enseño dentro de la comunidad MÁQUINA IA: las estaciones, los gates y el código que lo sostiene.

Pasos 1 a 3: casa, cerebro y harness

Paso 1, la casa. Te sirve un servidor en la nube o una computadora que ya tengas. La trampa: la documentación de Hermes Agent dice que el instalador de macOS es solo para Apple Silicon y que macOS en procesadores Intel no está soportado. Una Mac vieja con Intel no te sirve tal como está. Paso 2, el cerebro. Eliges el modelo y puedes cambiarlo después. La trampa que más duele: el harness pide una llave de API, y la API se cobra aparte por uso. Tu suscripción mensual del chat no la cubre. Paso 3, el harness. El que recomiendo en el video es Hermes Agent, de código abierto con licencia MIT, hecho por Nous Research. Se instala pegando una línea en la terminal, y después el comando hermes doctor te dice qué falta y cómo arreglarlo.

Pasos 4 a 6: identidad, manos y memoria

Paso 4, quién eres. Hermes lee un archivo de identidad llamado SOUL.md. Ahí escribes a qué te dedicas, quiénes son tus clientes y cómo quieres que te hable. Copia esta regla tal cual: antes de enviar un correo o de borrar algo, pregúntame primero. Paso 5, las manos. Correo, calendario, documentos y navegador. Hermes trae una skill de Google Workspace que se autoriza una vez, y cualquier aplicación con servidor MCP se conecta aparte. Paso 6, la memoria. Aquí se equivocan muchas listas de nueve pasos: te mandan a instalar Letta, y Letta no aparece entre los proveedores de memoria que documenta Hermes. Lo que sí documenta: Hermes ya recuerda entre sesiones con dos archivos, MEMORY.md y USER.md, que escribe él mismo. Si quieres memoria externa, el comando hermes memory setup te deja elegir entre ocho proveedores: Honcho, OpenViking, Mem0, Hindsight, Holographic, RetainDB, ByteRover y Supermemory.

Pasos 7 a 9: skills, canales y la cara

Paso 7, las skills. Una skill es una carpeta con un archivo de instrucciones en lenguaje normal que describe una tarea que repites. Empieza por la que más te duele repetir, no por diez. Paso 8, canales y voz. Telegram es el fácil: creas un bot con BotFather, pegas el token y le escribes desde el celular. WhatsApp tiene dos caminos, y la documentación los separa bien. El puente integrado usa Baileys, que emula una sesión de WhatsApp Web y no es la API oficial, así que usa un número dedicado. El camino oficial es la API de WhatsApp Business Cloud, sin riesgo de bloqueo, pero pide una cuenta de Meta Business. Para la voz no hace falta ningún producto aparte: el modo de voz de Hermes acepta ElevenLabs como proveedor. Paso 9, la cara. Hermes puede exponer un servidor compatible con la API de OpenAI, y cualquier interfaz que hable ese formato habla con tu JARVIS. Esa pantalla se la puedes pedir a Claude Code. La regla de seguridad que no se negocia: ese servidor escucha solo dentro de tu máquina. No lo abras a internet.

El detalle para quien habla español

Esto no cupo en el video y te va a ahorrar una tarde. En la documentación de Hermes, el idioma por defecto de la transcripción de voz es inglés. La propia documentación explica que la detección automática se equivoca con clips cortos o con acento, y que las notas de voz acaban transcritas en el idioma equivocado. Si le vas a hablar en español, pon el idioma de transcripción en es una sola vez en la configuración.

Lo que cuesta de verdad

El servidor es lo barato. Lo que sube es el uso: cada vez que tu JARVIS piensa gasta API, y cada vez que habla gasta voz. Es barato con tope y caro sin él, así que antes de conectar nada pon un límite de gasto mensual en cada proveedor. Y si nunca abriste una terminal, no pasa nada: haz un paso por día y en nueve días tienes lo mismo. Sabrás que terminaste cuando pase esto: le preguntas quién eres y contesta con lo tuyo, te resume la agenda de la semana, recuerda algo de ayer, corre una skill tuya de principio a fin, te responde por Telegram con voz y sigue vivo después de reiniciar el equipo.

Preguntas frecuentes

¿Puedo montar Hermes Agent en una Mac vieja con procesador Intel?
No tal como está. La documentación de Hermes Agent indica que el instalador de macOS es solo para Apple Silicon y que macOS en procesadores Intel no es una plataforma soportada. Si tienes una Mac Intel, la alternativa es instalarle Linux, usar otra computadora o montar tu JARVIS en un servidor en la nube.
¿Mi suscripción de Claude o ChatGPT cubre el uso de un JARVIS con Hermes?
No. El harness se conecta al modelo con una llave de API, y la API se cobra aparte por uso, independientemente de la suscripción mensual del chat. Es el primer muro con el que choca casi todo el mundo, por eso conviene poner un límite de gasto mensual en cada proveedor antes de conectar nada.
¿Hermes Agent tiene memoria entre conversaciones?
Sí. Según su documentación, Hermes mantiene dos archivos, MEMORY.md y USER.md, que escribe y actualiza él mismo entre sesiones. Si quieres memoria externa, el comando hermes memory setup te deja elegir entre ocho proveedores: Honcho, OpenViking, Mem0, Hindsight, Holographic, RetainDB, ByteRover y Supermemory.
¿Por qué Hermes transcribe mal mis notas de voz en español?
Porque el idioma por defecto de la transcripción de voz en Hermes es inglés, y la documentación reconoce que la detección automática falla a menudo con clips cortos o con acento. La solución es fijar el idioma de transcripción en es una sola vez en la configuración, y a partir de ahí tus notas de voz llegan bien.

Fuentes