Arquitectura · Soberanía de Datos · Chile

IA Híbrida en Chile: Qué Datos No Pueden Salir de su Red (y Cuánto Cuesta de Verdad Procesarlos en Casa)

El air-gap absoluto es sobreingeniería para casi todas las empresas. Pero el híbrido tampoco es la ganga que suele venderse: con salarios chilenos reales, el punto de equilibrio frente a la nube está alrededor de diez veces más arriba de lo que se publica. La buena noticia es que esa no es la razón para hacerlo.

Informe GrowMkTech: arquitectura de IA híbrida para datos sensibles en Chile

Resumen ejecutivo — seis cosas que la dirección debe saber

  • El air-gap absoluto casi nunca se justifica. Un sistema verdaderamente aislado obliga a replicar dentro del enclave el registro de contenedores, la PKI, la observabilidad y las dependencias, y a actualizar por medio físico firmado. Salvo mandato regulatorio explícito, la carga operativa no compensa.
  • La pregunta correcta no es dónde, es qué dato. La arquitectura se diseña desde una política de clasificación, no al revés. Sin esa política escrita, "híbrido" es solo una palabra.
  • La Ley 21.719 no exige procesar en Chile — exige otra cosa. Desde el 1 de diciembre de 2026 obliga a informar la existencia de decisiones automatizadas y la lógica aplicada, y a evaluar el impacto cuando hay perfilamiento con efectos jurídicos significativos. Eso golpea a la IA de frente, independientemente de dónde corra el modelo.
  • El costo dominante del on-premise es el personal, no la GPU. En Chile, 1,5 FTE de perfiles senior cuesta del orden de $95–110 millones al año. Una tarjeta de $4 millones amortizada a tres años es ruido al lado de eso.
  • El punto de equilibrio está muy arriba. Bajo supuestos declarados, la inferencia propia empieza a competir con la nube recién en torno a los 500 millones de tokens mensuales — y se duplica si se usa procesamiento por lotes.
  • Entonces, ¿por qué hacerlo? Porque hay datos que no pueden salir de la red por razones legales o contractuales. Esa es la justificación honesta. El ahorro llega mucho después, y a veces nunca.
1-dic-2026
Entran en vigencia los deberes sobre decisiones automatizadas de la Ley 21.719
~$100M
Costo anual en CLP de 1,5 FTE senior en Chile — el rubro que decide el TCO
40–70%
De las llamadas en sistemas agénticos podrían resolverse con modelos pequeños (NVIDIA Research)
~17 GB
VRAM que necesita Qwen3.6-27B en 4 bits: entra en una sola GPU de 24 GB

1. Qué significa "air-gapped" de verdad

La palabra se usa mal casi siempre. "Air-gapped" no quiere decir "está en un servidor nuestro". Significa que no existe ninguna ruta por la cual un paquete pueda salir: sin gateway de NAT, sin resolución DNS a nombres externos, sin cadena de certificados pública que validar. Todo lo que el sistema necesita —modelos, dependencias, registro de contenedores, observabilidad, PKI interna— tiene que pre-existir dentro del enclave. Las actualizaciones entran por medio físico firmado, en ciclos lentos.

Eso tiene consecuencias que las organizaciones subestiman sistemáticamente. Cada dependencia de Python que su equipo instalaría con un comando pasa a requerir un mirror interno. Cada certificado que vence hay que renovarlo con una autoridad propia. Cada actualización de seguridad del modelo base llega semanas después que al resto del mundo. No es un problema técnico: es un problema de personal permanente.

El malentendido más caro: "lo tenemos en un servidor propio, así que está aislado"

Un servidor en su sala de máquinas que resuelve DNS, descarga imágenes de Docker Hub y envía métricas a un SaaS no está aislado: está en su edificio, que es otra cosa. La distinción importa porque el riesgo real que se quiere evitar —que un texto con datos personales termine en un tercero— no depende de dónde está el rack, sino de qué conexiones salientes existen. Y hay una fuga que se repite: generar los embeddings con una API externa. Se cuida el modelo de lenguaje, se monta todo local, y luego cada documento del RAG se envía íntegro a un servicio de terceros para vectorizarlo. Es la forma más común de romper el perímetro sin darse cuenta.

2. La pregunta correcta no es dónde, es qué dato

Antes de comparar GPUs conviene responder una pregunta de negocio: ¿qué información, si apareciera mañana en un log de un proveedor extranjero, sería un problema legal, contractual o reputacional? Esa lista es el insumo de toda la arquitectura. Sin ella, cualquier decisión de infraestructura es una corazonada cara.

Y aquí conviene corregir un malentendido frecuente: la normativa chilena no obliga a procesar los datos dentro del país ni prohíbe usar servicios en la nube. Lo que hace la reforma es otra cosa, y es más incómoda para quien usa IA.

La Ley 21.719 —publicada el 13 de diciembre de 2024, con entrada en vigencia el 1 de diciembre de 2026— no deroga la antigua Ley 19.628: la modifica en profundidad y la rebautiza. Y entre lo que introduce hay tres piezas que apuntan directo a los sistemas automatizados:

  • Deber de informar decisiones automatizadas. El nuevo artículo 14 ter, letra l), obliga a informar la existencia de decisiones automatizadas, incluida la elaboración de perfiles, y a entregar "información significativa sobre la lógica aplicada" y las consecuencias previstas para la persona.
  • Evaluación de impacto obligatoria. Cuando hay evaluación sistemática de aspectos personales basada en perfilamiento con efectos jurídicos significativos, tratamiento a gran escala, o monitoreo sistemático de zonas de acceso público.
  • Protección desde el diseño y por defecto (artículo 14 quáter): el control no se agrega al final, se construye desde el principio.

Dicho de otro modo: usted puede usar una API extranjera y cumplir, y puede montar todo en su sala de máquinas e incumplir. Lo que se fiscaliza es la trazabilidad, la información al titular y la evaluación previa — no la geografía del servidor.

SectorNorma que realmente aplicaQué exige, en la práctica
TransversalLey 19.628, reformada por la Ley 21.719 (vigente 1-dic-2026)Informar decisiones automatizadas y su lógica; evaluación de impacto en perfilamiento; protección desde el diseño. Multas de hasta 20.000 UTM y, en reincidencia de empresas que no son de menor tamaño, hasta el 4% de los ingresos anuales.
Banca y medios de pagoCapítulo 20-10 de la RAN de la CMF (vigente desde el 1-dic-2020), con los capítulos 20-9 y 20-8Estrategia de seguridad de la información aprobada por el Directorio, gestión de riesgos, activos críticos, detección y respuesta a incidentes, continuidad del negocio.
SaludLey 20.584, artículos 12 y 13, y su reglamento D.S. 41/2012 del MINSALLa información de la ficha clínica es dato sensible por definición legal, y el prestador debe conservarla al menos 15 años bajo su responsabilidad.
Sector públicoLey 19.628 (alcanza expresamente a los órganos del Estado desde dic-2026), Ley 20.285 y Ley 21.180Tratamiento sujeto a la ley general de datos, en concordancia con acceso a la información pública y transformación digital del Estado.
Servicios esenciales y operadores de importancia vitalLey 21.663, Marco de Ciberseguridad (vigente desde 2025)Reporte de incidentes en 3 horas, actualización en 72 (24 para OIV) e informe final en 15 días. Ojo: obliga por caer en el artículo 4°, no por usar IA.

¿Y una ley de IA? Chile todavía no la tiene. El proyecto que regula los sistemas de inteligencia artificial (Boletín N° 16.821-19), con enfoque por niveles de riesgo, fue aprobado por la Cámara de Diputados en octubre de 2025 y está en segundo trámite en el Senado. Un dato que conviene anotar para planificar: el proyecto propone que la fiscalización quede en manos de la misma Agencia de Protección de Datos Personales, no de un regulador nuevo. Quien ordene sus datos ahora llegará mejor parado a esa ley.

3. La arquitectura híbrida: tres capas y un enrutador que decide todo

El diseño es simple de dibujar y difícil de hacer bien. Un enrutador clasifica cada consulta contra la política de datos; lo sensible se queda en el perímetro local, lo genérico sale a una API. La gobernanza —identidad, permisos, registros de auditoría— es transversal a ambos lados: es un puente, no un muro.

Gráfico 1

Las tres capas y el punto donde se juega la seguridad

Arquitectura de IA híbrida con enrutador de clasificación Consulta del usuario chat, RAG, agente, proceso batch Enrutador de clasificación ¿RUT, ficha clínica, monto, contrato, dato de un tercero? SENSIBLE GENÉRICO PERÍMETRO LOCAL Modelo abierto (Qwen3.6-27B u otro) Base vectorial propia (pgvector, Qdrant) Embeddings locales — nunca por API Observabilidad on-prem El dato no cruza el borde de la red API EN LA NUBE Modelo frontera para el caso difícil Multimodal, código, razonamiento Búsqueda web en tiempo real Elasticidad ante picos Solo contenido sin dato personal Gobernanza transversal Identidad y permisos · registros de auditoría · política de clasificación versionada · evidencia para la Agencia

El enrutador es el componente que determina si la arquitectura es segura o solo lo parece. Elaboración GrowMkTech.

Dos advertencias sobre el enrutador, que es donde se pierde o se gana todo:

  • Empiece por reglas, no por un modelo. Un puñado de expresiones regulares bien escritas —RUT, número de ficha, IBAN, patrones de dirección— más una lista de orígenes de datos marcados como sensibles cubre la mayoría de los casos y es auditable. Un clasificador entrenado es mejor después, cuando ya tiene volumen para evaluarlo; antes es una caja negra que nadie puede justificar ante un fiscalizador.
  • Falle hacia adentro. Si el enrutador no está seguro, la consulta se queda local. El costo de procesar de más en casa es una GPU ocupada; el costo de enviar de más a un tercero puede ser una notificación de incidente.

4. Qué modelo local usar realmente en 2026

Este es el punto donde envejece más rápido cualquier artículo, y donde circula más información vieja. Los modelos que todavía se recomiendan en muchos textos —Llama 3.3, Qwen 2.5, Mistral 7B, la primera generación de DeepSeek— ya fueron superados, algunos por dos generaciones. Estas son las opciones vigentes al momento de escribir, con la licencia que realmente tienen:

Perfil de hardwareModeloVRAM aprox. en 4 bitsLicencia
1 GPU de 16 GBMinistral 3 (14B) · gpt-oss-20b~10–16 GBApache 2.0
1 GPU de 24 GB — el punto dulceQwen3.6-27B (denso, contexto nativo de 262K)~17 GBApache 2.0
1 GPU de 24–32 GBQwen3.6-35B-A3B (MoE, 3B activos por token)~22 GBApache 2.0
Prioridad en español y lenguas ibéricasSalamandra 7B / 40B (Barcelona Supercomputing Center)~5 GB / ~25 GBApache 2.0
2 GPU de 48 GBMistral Small 4 · Gemma 4~40 GBApache 2.0
Clúster (fuera del alcance de una pyme)DeepSeek V4-Flash · GLM-5.2160–400 GBMIT

Una regla práctica para dimensionar: en cuantización de 4 bits, cuente alrededor de 0,6 GB por cada mil millones de parámetros, más la caché de contexto, más un 15–20% de holgura. Un modelo de 70B necesita del orden de 40 GB solo en pesos — y la caché puede duplicar el consumo en escenarios de contexto largo.

Cuidado con dos cosas al elegir modelo

La licencia no siempre es lo que parece. La familia Llama no es Apache 2.0: es una licencia comunitaria de Meta con restricciones de uso. Kimi K3 tiene licencia propia, no MIT. En una revisión legal corporativa esto importa, y es de las cosas que aparecen tarde y caro.

No existe un ranking público y riguroso de modelos abiertos en español. Lo que circula son artículos sin metodología publicada. Cualquiera que afirme "el mejor modelo en español es X" está opinando. La única salida seria es evaluar dos o tres candidatos con su propio corpus y sus propias preguntas — un par de días de trabajo que evita meses de arrepentimiento.

Sobre las herramientas: una que hay que sacar de la lista

Text Generation Inference (TGI), de Hugging Face, está en modo mantenimiento. Su propio repositorio lo declara y redirige a vLLM, SGLang, llama.cpp y MLX. Si un proveedor se lo propone hoy como motor de inferencia, es señal de que está trabajando con material viejo.

El reparto razonable hoy: Ollama para prototipar y para un usuario; vLLM como estándar de producción; y SGLang cuando las peticiones comparten contexto —chatbots, RAG, agentes—, que es precisamente el caso de uso empresarial. En bases vectoriales las cuatro conocidas siguen vigentes: pgvector si ya tiene PostgreSQL (lo más sensato por debajo de unos pocos millones de vectores), Qdrant como opción independiente con filtrado rápido, Weaviate para búsqueda híbrida y Milvus a escala de miles de millones.

5. Latam-GPT: qué es realmente y qué no

Chile lanzó Latam-GPT el 10 de febrero de 2026, a través del CENIA, con más de 65 instituciones de 15 países y respaldo de CAF y del Ministerio de Ciencia. Los pesos se publicaron en Hugging Face en mayo de 2026. Es un hito regional genuino y conviene entenderlo bien, porque circula bastante información incorrecta.

Lo que se suele decirLo que es
"Unos 50 mil millones de parámetros"70 mil millones. El modelo se llama literalmente Llama-3.1-70B-LatamGPT-SFT-1.0. La cifra de 50B viene de estimaciones previas al lanzamiento.
"Entrenado con 8 TB de datos"Los 8 TB corresponden al corpus recolectado en una etapa anterior. El entrenamiento efectivo usó del orden de 297 mil millones de tokens.
"Supercomputador solar en Atacama"El equipo está en la Universidad de Tarapacá, en Arica — a unos 2.000 km de Atacama. La confusión viene de proyectos privados de data centers en el desierto de Atacama que no tienen relación con Latam-GPT.
"Es código abierto"Hereda la licencia comunitaria de Llama 3.1, que no es una licencia open source aprobada por la OSI e impone restricciones de uso.
"Sirve para desplegar en mi empresa"Requiere del orden de 140 GB de VRAM para inferencia. Eso es un clúster, no un servidor de pyme.

La versión 1.0 se entrenó en la nube de AWS, y el plan es entrenar las siguientes en el supercomputador de Arica, alimentado por una matriz energética casi enteramente renovable. Vale la pena señalar la crítica que ya le hicieron especialistas locales, porque es pertinente para cualquiera que hable de soberanía: un modelo construido sobre pesos de Meta y entrenado en infraestructura de Amazon matiza bastante el discurso de independencia tecnológica. Eso no le quita mérito al proyecto — lo sitúa.

Recomendación práctica: siga Latam-GPT, evalúelo cuando necesite español regional con menor sesgo cultural, pero no funde su arquitectura de 2026 en él. Para desplegar hoy, un modelo de 14 a 35 mil millones de parámetros con licencia Apache 2.0 le dará mejor relación entre capacidad, costo y tranquilidad jurídica.

6. Los números reales: el TCO que casi nadie calcula bien

Aquí es donde la mayoría de los análisis se equivocan, y se equivocan siempre en la misma dirección: comparan el precio de una GPU contra la factura mensual de una API, y concluyen que el hardware se paga en meses. El problema es que el hardware es el rubro menor.

Los rangos salariales del mercado chileno en 2026, para perfiles senior en la Región Metropolitana, están en torno a $2,8–6,5 millones brutos mensuales para un platform engineer y $5,0–8,5 millones para un ML/AI engineer. Sumando costo empresa, mantener 1,5 FTE dedicados a operar una plataforma de inferencia cuesta del orden de $95 a $110 millones de pesos al año. Al lado de eso, una RTX 5090 de unos $4,1 millones amortizada en tres años es un detalle contable.

Gráfico 2

Costo anual comparado: la nube gana hasta que el volumen se vuelve enorme

Costo anual comparado entre nube y operación propia Millones de CLP al año 50 MILLONES DE TOKENS / MES Nube: $3,0M Propia: ~$32M  — 10 veces más cara 150 MILLONES DE TOKENS / MES Nube: $8,9M Propia: ~$32M  — 3,6 veces más cara 500 MILLONES DE TOKENS / MES Nube: $29,8M Propia: ~$32M  — se cruzan aquí Con procesamiento por lotes (−50%) o caché de contexto, el cruce se desplaza al doble de volumen. Barras a escala.

Supuestos declarados: dólar a $920 CLP. Precio de lista de Claude Sonnet 5 ($3 por millón de tokens de entrada / $15 de salida), con una mezcla de 80% entrada y 20% salida, lo que da un promedio de US$5,4 por millón. Operación propia: servidor de una GPU amortizado a tres años (~$2,0M/año), electricidad continua a ~$195 CLP/kWh (~$0,8M/año) y medio cargo de platform engineer (~$29M/año) — el escenario más barato defendible, no el típico. Modelo de elaboración propia de GrowMkTech; su caso debe recalcularse con sus cifras.

Léase con cuidado lo que dice el gráfico: 500 millones de tokens al mes. Para dimensionarlo, eso equivale a procesar del orden de 375 millones de palabras mensuales — el tipo de volumen que genera una operación con cientos de usuarios concurrentes o un procesamiento documental masivo y continuo. La gran mayoría de las empresas medianas chilenas está uno o dos órdenes de magnitud por debajo.

Y hay dos factores que empujan el cruce todavía más arriba: el procesamiento por lotes reduce el precio a la mitad en los principales proveedores, y la caché de contexto puede bajar hasta un 90% el costo de los tokens de entrada. Un caso de uso con contexto estable y tolerancia a la latencia paga una fracción del precio de lista.

El mito del "break-even en cuatro meses"

Circula mucho la idea de que sobre 50 millones de tokens mensuales el hardware propio se paga en menos de medio año. Ese cálculo solo funciona si se omite el personal o se le asigna un costo irreal. Nadie opera un clúster de inferencia sin alguien que lo opere: parches, actualizaciones de modelo, monitoreo, respuesta a incidentes, gestión de cuantizaciones. Si su proveedor le presenta un TCO donde el rubro de personal no aparece o aparece simbólicamente, pida que lo reponga y vuelva a mirar la conclusión.

Sobre el hardware en Chile: dos precisiones útiles

No hay ninguna traba regulatoria. Se repite que las restricciones de exportación de Estados Unidos dificultan traer A100 o H100 a Chile. Es falso: Chile pertenece al Country Group B del régimen de exportación estadounidense, fuera de los grupos que sí enfrentan controles sobre computación avanzada. Las barreras reales son de costo, plazo y canal: estas GPU no están en retail, van por cotización a través de los distribuidores autorizados de NVIDIA en Chile —Ingram Micro, Intcomex y Bell Micro.

Para el rango de trabajo real, la referencia hoy es la RTX 5090 (32 GB), disponible en retail chileno en torno a los $4,1–5,0 millones. La RTX 4090 quedó descontinuada en el canal local, así que si una cotización se la ofrece como equipo nuevo, conviene preguntar de dónde sale.

7. Cómo implementarlo sin comprar nada el primer día

La secuencia importa más que la tecnología. El error caro no es elegir el modelo equivocado: es comprar infraestructura para una demanda que se proyectó en una planilla y nunca se midió.

Días 1–30 · Validar sin CapEx

  1. Instale Ollama con un modelo de 8B–14B en tres o cuatro estaciones de trabajo que ya tengan GPU. Costo de infraestructura nueva: cero.
  2. Piloto con 10 usuarios de áreas distintas. Mida tres cosas: calidad percibida, latencia y —la más valiosa— qué casos de uso aparecen solos, que casi nunca son los que estaban en el plan.
  3. Escriba la política de clasificación de datos. Una página basta: qué información no puede salir de la red, quién lo decide y qué se hace ante la duda.
  4. Instrumente el conteo de tokens desde el primer día. Sin ese dato, toda decisión posterior de infraestructura es una corazonada.

Días 31–60 · Enrutar y medir

  1. Construya el enrutador con reglas explícitas y auditables. Que registre cada decisión: qué se quedó local, qué salió y por qué.
  2. Monte la base vectorial y migre un corpus documental acotado pero real. Embeddings locales, sin excepción.
  3. Integre con la identidad corporativa que ya usa, para que los permisos del sistema sean los mismos permisos de siempre.
  4. Empiece a acumular la evidencia que pedirá la Agencia desde diciembre: registro de decisiones automatizadas y de la lógica aplicada.

Días 61–90 · Decidir con datos, no con folletos

  1. Revise el volumen observado —no el proyectado— y calcule su punto de equilibrio con sus propias cifras y con el costo real de operación incluido.
  2. Si el volumen no justifica hardware, no lo compre. Deje el perímetro local acotado a lo verdaderamente sensible y siga con la nube para el resto: esa también es una arquitectura híbrida, y es la correcta para la mayoría.
  3. Si lo justifica, dimensione a partir del modelo elegido y de la caché de contexto que su caso de uso necesita, no del catálogo del proveedor.
  4. Documente la evaluación de impacto si hay perfilamiento con efectos significativos sobre personas. Le va a hacer falta.

Cuatro cosas que puede hacer esta semana

  • Audite las consultas DNS salientes de los servidores que ya procesan datos con IA. Es la forma más rápida de descubrir una fuga por embeddings remotos.
  • Pregunte a sus proveedores de SaaS con IA dónde se procesan sus datos, si se usan para entrenamiento y cuánto tiempo se retienen. Por escrito.
  • Haga la lista de datos que no pueden salir. Media hora con las jefaturas de finanzas, personas y operaciones alcanza para el primer borrador.
  • Levante cuánto está gastando hoy en APIs de IA, sumando lo que pagan las distintas áreas por separado. Suele haber sorpresas en ambas direcciones.

8. Los riesgos que sí hay que mirar

RiesgoPor qué ocurreCómo se mitiga
Hardware subutilizadoSe compra por demanda proyectada, no observadaEdge-first: no adquirir GPU hasta tener tres meses de volumen medido
Fuga por embeddings remotosSe protege el modelo de lenguaje y se olvida el vectorizadorEmbeddings locales obligatorios; auditoría periódica de tráfico saliente
El enrutador es una ilusiónSe confía en un clasificador sin evaluar, o falla hacia afueraReglas auditables primero; ante la duda, la consulta se queda local; registro de cada decisión
El costo de personal aparece despuésEl TCO se armó solo con hardware y electricidadPresupuestar 1–1,5 FTE desde el día cero, o asumir servicio gestionado
Escasez de perfiles MLOps en ChileMercado pequeño y muy demandadoUn senior que forme internamente, antes que dos contrataciones que no llegan
El modelo local queda obsoletoEl ciclo de publicación es de meses, no de añosAbstraer detrás de una API compatible con el estándar del mercado, para poder cambiar de motor sin reescribir

9. Conclusión

La arquitectura híbrida es, para casi todas las empresas chilenas, la respuesta correcta. Pero conviene adoptarla por la razón correcta.

No la adopte para ahorrar: con los costos reales de operación en Chile, la nube es más barata hasta volúmenes que la mayoría no alcanza. Adóptela porque hay información —fichas clínicas, antecedentes financieros, datos de terceros bajo contrato— que no debería cruzar el borde de su red, y porque a partir de diciembre de 2026 tendrá que poder demostrar cómo la trató, no solo declararlo.

Y empiece por lo barato. Un piloto con modelos abiertos en equipos que ya tiene, una política de clasificación de una página y un contador de tokens le dirán en noventa días, con datos propios, si alguna vez necesitará comprar una GPU. La mayoría descubre que no — y esa también es una conclusión valiosa, porque llega antes de la orden de compra.

Metodología y fuentes

Este artículo se elaboró verificando cada dato contra fuente primaria antes de redactar. Las cifras de mercado que no pudieron confirmarse con fuente pública fueron descartadas en lugar de estimarse. Referencias principales: BCN — Ley 21.719 · BCN — Ley 19.628 · BCN — Ley 20.584 (ficha clínica) · BCN — Ley 21.663 de Ciberseguridad · CMF — Capítulo 20-10 RAN · Senado — Proyecto de ley de IA (Boletín 16.821-19) · CENIA — Lanzamiento de Latam-GPT · Hugging Face — Ficha técnica de Latam-GPT · Hugging Face — Qwen3.6-27B · Hugging Face — TGI en modo mantenimiento · NVIDIA Research — Small Language Models are the Future of Agentic AI (arXiv:2506.02153) · Anthropic — Precios de la plataforma · BIS — Country Groups del régimen de exportación · SII — Dólar observado 2026 · IT Workers — Guía Salarial Tech Chile 2026.

Nota de precisión. (1) La Ley 21.719 no está vigente aún: rige desde el 1 de diciembre de 2026. Hasta esa fecha se aplica el texto actual de la Ley 19.628. Por eso todas las obligaciones descritas se enuncian en futuro. (2) La Ley 21.719 modifica la Ley 19.628, no la deroga: la reforma y la rebautiza como ley "sobre Protección de los Datos Personales". (3) El modelo de costos del Gráfico 2 es elaboración propia a partir de precios de lista públicos y rangos salariales de mercado; no es una medición de casos reales y cambia con el tipo de cambio, la mezcla de tokens y la opción tarifaria eléctrica contratada. Las tarifas eléctricas chilenas no son un único $/kWh: se descomponen en cargos por energía y potencia y varían por distribuidora y opción tarifaria, por lo que el valor usado es referencial. (4) La proporción de consultas delegables a modelos pequeños (40–70%) proviene de un paper de NVIDIA Research basado en tres casos de estudio y referido a subtareas agénticas, no a consultas empresariales en general; se cita como orden de magnitud, no como regla. Descartamos deliberadamente la cifra "80% local / 20% nube" que circula en la industria porque no tiene respaldo verificable. (5) El costo de desarrollo de Latam-GPT (US$550.000) proviene de declaraciones a la prensa, no de documento oficial de CENIA. (6) Los precios de hardware y de APIs son de agosto de 2026 y cambian con frecuencia; verifíquelos antes de decidir. (7) Este artículo es divulgativo y no constituye asesoría legal. (8) El roadmap, los recuadros y las recomendaciones son elaboración de GrowMkTech a partir de la evidencia citada y de nuestra experiencia en proyectos de datos e IA en Chile.

🧩

¿Qué datos de su empresa no deberían salir de la red?

En GrowMkTech diseñamos e implementamos arquitecturas híbridas: política de clasificación, enrutador auditable, modelos locales y la evidencia que pedirá la Agencia desde diciembre de 2026. Partimos midiendo, no comprando hardware.

¿Podemos ayudarte?