Guía de despliegue

Despliegue Hedy en su propia infraestructura.

Hedy es un empleado de IA de despliegue privado. Se ejecuta donde usted lo ejecuta: una VM con Docker Compose para un piloto, Helm sobre Kubernetes para alta disponibilidad, o totalmente air-gapped (aislado de red) con modelos locales. Un piloto está en marcha en unos 30 minutos. Aquí no hay ningún registro en la nube; toda la pila queda dentro de su perímetro.

Elija un modo

Ideal paraCómoHA
Docker ComposePiloto / un solo equipodocker compose up -d en una VMNodo único
Kubernetes (Helm)Producción / escalaHelm chart en su clústerMultirréplica, StatefulSet
Air-gappedRedes sin internetCompose/Helm + vLLM u Ollama local; licencia Ed25519 offlineCualquiera
Pasarela Managed (gestionado)Cero configuración de modelosEnrute las llamadas a modelos a la pasarela de Hedy; todo lo demás sigue siendo suyoCualquiera

Self-hosted / BYO es la opción insignia: sus claves, sus modelos, cero subencargados (sub-processors). Managed cambia eso por velocidad sin configuración y modifica los hechos de residencia de datos; consulte el modelo de seguridad.

Antes de empezar

P-01

Un host que usted controla

Una VM Linux en su VPC (un piloto va cómodo con ~2 vCPU / 8 GB; amplíe para recuperación más pesada). Docker + Compose, o un clúster de Kubernetes para Helm.

P-02

Un canal de chat

Una app de Feishu o Lark (soporte de primer nivel), o Slack. Aquí es donde vive y responde el empleado.

P-03

Acceso a modelos

Sus propias claves de API — compatibles con Anthropic u OpenAI, o proveedores chinos como DeepSeek, Qwen, Kimi y GLM — o un endpoint local de vLLM / Ollama para air-gapped. O ejecute Managed y omita esto.

P-04

Una fuente de conocimiento

Apunte Hedy a un wiki, Git, Notion o Confluence. Opcional el primer día; la recuperación recurre a texto completo hasta que se configuren los embeddings.

P-05

Un archivo de licencia Ed25519

Verificado offline — sin phone-home. Colóquelo antes del primer arranque (compatible con air-gap).

Piloto en ~30 minutos (Compose)

01

Obtenga la release y la licencia

Descargue las imágenes ancladas a semver (nunca latest) y coloque su licence.json. El repositorio incluye solo un .env.example — los secrets se inyectan, nunca se suben al repositorio.

02

Complete .env

Configure las credenciales del canal, las claves de modelos (o apunte a vLLM/Ollama local), y un token interno robusto. Vincule los puertos publicados a 127.0.0.1 detrás de su proxy inverso.

03

docker compose up -d

Se levantan Postgres, Redis, el plano de control, la pasarela de LLM y el agente. Los health checks controlan la disponibilidad.

04

Conecte el canal

Añada la app a su workspace de Feishu/Lark o Slack; el empleado se presenta y ejecuta una autocomprobación.

05

Apunte al conocimiento y pregunte

Añada una fuente, haga una pregunta — la respuesta llega citada, limitada a lo que el solicitante puede ver. Primer entregable en minutos.

Lo que el despliegue le ofrece, por diseño

D-01

Vinculado a loopback, detrás de su proxy

Los puertos publicados se vinculan a 127.0.0.1; su proxy inverso termina el TLS. La publicación de puertos de Docker elude los firewalls del host — la vinculación a loopback es el límite fiable.

D-02

Los secrets son solo de entorno

Las credenciales entran mediante inyección desde el entorno de despliegue. El repositorio incluye un archivo de ejemplo; el agente tiene la regla estricta de nunca almacenar valores de credenciales en memoria, archivos ni logs.

D-03

Un único punto de control de medición

Cada llamada a modelo pasa por una única pasarela que controla la cuota, la contabilidad de costos y la política de degradación — de modo que el gasto es medible por equipo y proyecto, y nada la elude.

D-04

Auditoría append-only desde la primera acción

Cada acción se registra con actor, objeto y razonamiento — sin vía de actualización ni de borrado, ni para el agente ni para los administradores.

Opere: actualice, haga copias de seguridad, manténgase offline

O-01

Las actualizaciones preservan la memoria

Las imágenes están ancladas a semver. El conocimiento aprendido y la memoria del empleado viven en volúmenes preservados y respaldables — una actualización nunca reinicia lo que el empleado ha aprendido.

O-02

Scripts de copia de seguridad y restauración incluidos

Se entregan con runbooks de copia de seguridad/restauración/actualización; sus datos son su Postgres, en su host.

O-03

Ciclo de vida de la licencia, offline

Máquina de estados Ed25519: activa → gracia (solo lectura) → expirada. Verificada localmente, sin llamada externa — lista para air-gap.

Solicite una llamada de despliegue Lea el modelo de seguridad

Preguntas

¿Cuáles son las especificaciones mínimas para un piloto?
Una sola VM Linux con aproximadamente 2 vCPU y 8 GB de RAM ejecuta un piloto Compose cómodo. La recuperación más pesada y las bases de conocimiento más grandes se benefician de más memoria; la producción se ejecuta en Kubernetes vía Helm con múltiples réplicas.
¿Puede ejecutarse totalmente air-gapped?
Sí. Apunte la pasarela a un endpoint local de vLLM u Ollama dentro del perímetro; el licenciamiento es offline vía Ed25519 sin phone-home. Las APIs compatibles con Anthropic y OpenAI — incluidos proveedores chinos como DeepSeek, Qwen, Kimi y GLM — funcionan de forma idéntica cuando son accesibles.
¿Cuánto tarda un primer despliegue?
Alrededor de 30 minutos para un piloto Compose: coloque la licencia, complete .env, docker compose up -d, conecte un canal, apunte a una fuente de conocimiento. Los despliegues de producción con Helm tardan más en integrarse en su clúster y su IdP.
¿Las actualizaciones pierden la memoria del empleado o el conocimiento aprendido?
No. Las imágenes están ancladas a semver, y el conocimiento aprendido y la memoria viven en volúmenes preservados y respaldables, independientes de la capa de imagen — actualizar la imagen no reinicia lo que el empleado ha aprendido.
¿Cómo se gestionan los secrets y las claves de modelos?
Solo inyección desde el entorno. El repositorio incluye un .env.example sin valores reales; el agente tiene la regla estricta de nunca escribir valores de credenciales en memoria, archivos ni logs, y las claves de modelos se usan solo del lado del servidor detrás de la pasarela.