IA sin mandar datos fuera: LLM local para despachos y PyMEs
Tabla de Contenidos
Cuando un despacho pega el borrador de un contrato en ChatGPT, o una asesoría sube la nómina para que se la resuma, está haciendo algo que tiene nombre jurídico: una transferencia internacional de datos personales. No es una opinión, es el régimen que aplica.
Eso no significa que sea ilegal. Significa que hay un régimen que cumplir, y que la mayoría de las empresas pequeñas que usan IA a diario no saben que están dentro de él.
La alternativa —ejecutar el modelo en tu propio hardware, sin que el dato salga— lleva dos años siendo viable y este año se ha vuelto cómoda. Este artículo cuenta qué resuelve de verdad, qué no resuelve (que es la parte que nadie te cuenta) y cómo montarlo.
Escribo desde una máquina que lo corre: Ollama 0.32.6, 10 modelos y 122 GB en disco, sobre una Radeon RX 7900 XTX de 24 GB — no una NVIDIA, que es el caso que todo el mundo documenta y casi nadie contradice.
El marco legal, sin exagerarlo
Aquí hay mucho contenido de consultora vendiendo miedo. Vamos con lo que está verificado y con fecha.
Europa: la nube estadounidense es legal hoy, pero es una apuesta
Las transferencias de datos personales a Estados Unidos se amparan hoy en el EU-US Data Privacy Framework, la decisión de adecuación de la Comisión de 2023. El Tribunal General de la UE la confirmó el 3 de septiembre de 2025 al desestimar el recurso de Philippe Latombe.
Así que a día de hoy, usar un proveedor estadounidense adherido al marco es perfectamente legal.
El matiz importa: Latombe recurrió ante el TJUE el 31 de octubre de 2025 (asunto C-703/25 P) y el recurso sigue pendiente. Y hay antecedente: este es el tercer intento. Safe Harbour cayó en 2015 con Schrems I; Privacy Shield cayó en 2020 con Schrems II. Los dos por el mismo motivo de fondo, que no ha desaparecido.
Traducido a decisión de negocio: no estás incumpliendo, estás dependiendo de una decisión de adecuación que ya se ha caído dos veces. Si tu proceso crítico se apoya en eso, sabes cuál es el riesgo y cuánto costaría rehacerlo con prisa.
México: la nube fuera del país ya es transferencia internacional
La nueva LFPDPPP se publicó en el DOF el 20 de marzo de 2025 y entró en vigor al día siguiente, sustituyendo a la de 2010.
Lo que cambia el cálculo para cualquier PyME mexicana: si usas un proveedor de nube con servidores fuera de México para tratar datos de clientes, empleados o proveedores, estás activando el régimen de transferencia internacional. Y el artículo 36 solo admite transferencias sin consentimiento en supuestos tasados y estrechos.
Además, con la desaparición del INAI, la autoridad pasó a la Secretaría Anticorrupción y Buen Gobierno.
El AI Act aplica aunque el modelo sea tuyo
Esta es la que más se malinterpreta, así que va en negrita: ejecutar el modelo localmente no te libera del artículo 50 del Reglamento (UE) 2024/1689.
Desde el 2 de agosto de 2026 las obligaciones de transparencia son exigibles y sancionables:
- Un chatbot debe avisar de que es una máquina.
- El contenido sintético debe llevar marcado legible por máquina.
- Los deepfakes deben declararse.
Y aplica con independencia de cuándo se puso el sistema en el mercado. El artículo 99.4 sitúa estas infracciones en el tramo de hasta 15 millones de euros o el 3 % del volumen de negocio anual mundial, el que sea mayor — con criterios de proporcionalidad para PyMEs.
Ojo con la cifra, porque circula mal: el tramo de 35 M€ / 7 % es el de prácticas prohibidas, no el de transparencia.
Qué resuelve un modelo local, y qué no
Esta tabla es el corazón del artículo. Si te llevas una sola cosa, que sea esta.
| Nube (OpenAI, Anthropic, Google) | Local (Ollama en tu servidor) | |
|---|---|---|
| Transferencia internacional | ✅ La hay, con su régimen | ❌ No la hay. El dato no sale |
| Encargado del tratamiento | Contrato con el proveedor | No hay tercero |
| Dependencia de adecuación | Sí (DPF, bajo recurso) | Ninguna |
| Retención por el proveedor | Según política y plan | Cero |
| Base de licitud | Sigue haciendo falta | Sigue haciendo falta |
| Registro de actividades de tratamiento | Sigue haciendo falta | Sigue haciendo falta |
| Evaluación de impacto (EIPD) | Puede hacer falta | Puede hacer falta igual |
| Deber de información al interesado | Sí | Sí |
| AI Act art. 50 (avisar que es IA) | Sí | Sí, exactamente igual |
| Derechos ARCO / supresión | Vía proveedor | Tuyos, y tuya la responsabilidad |
Lo que un modelo local te quita de encima es la fila de arriba: desaparece la transferencia internacional, desaparece el encargado externo y desaparece la dependencia de una decisión de adecuación que está recurrida.
Lo que no te quita es todo lo demás. Sigues tratando datos personales, así que sigues necesitando base de licitud, información al interesado, registro de actividades y, según el caso, evaluación de impacto. Local no es sinónimo de cumplidor. Es una pieza, no el edificio.
Si alguien te vende «con IA local ya cumples el RGPD», está simplificando hasta el punto de equivocarse.
El hardware: qué necesitas de verdad
La pregunta que más se hace, y la que peor se responde. La regla práctica es simple:
Necesitas VRAM suficiente para que el modelo quepa entero. Si no cabe, se reparte con la RAM del sistema y la velocidad se desploma.
Un modelo cuantizado a Q4_K_M —el estándar de facto, buena calidad y tamaño razonable— ocupa aproximadamente 0.6 GB por cada mil millones de parámetros, más el contexto.
| VRAM | Qué mueve con holgura | Para qué sirve |
|---|---|---|
| 8 GB | Modelos de 7-8B | Resúmenes, clasificación, extracción |
| 12-16 GB | Hasta 14B, o 20B justo | Redacción, análisis de documentos |
| 24 GB | Cómodo hasta 27-30B | Trabajo real de despacho |
| 48 GB+ | 70B y más | Cuando la calidad manda sobre el coste |
Los 24 GB son el punto dulce en 2026: es donde entran los modelos de 27-30B cuantizados, que es la primera franja donde un modelo abierto redacta y razona lo bastante bien como para sustituir tareas reales.
Un apunte sobre AMD, que nadie escribe
Casi todo el contenido de LLM local asume NVIDIA y CUDA. Esta máquina corre una Radeon RX 7900 XTX de 24 GB y Ollama funciona sin drama.
Merece decirlo porque el precio por gigabyte de VRAM en AMD es sensiblemente mejor, y para inferencia —que es lo único que vas a hacer aquí, no entrenar— la diferencia práctica es mucho menor de lo que sugiere el consenso de internet. Si vas a comprar hardware para esto, no descartes AMD por inercia.
Lo que sí conviene: dejar RAM de sistema suficiente. Esta tiene 32 GB asignados y 14 procesadores, y con eso el sistema respira mientras el modelo trabaja.
Montarlo: de cero a funcionando
# Linux o WSL
curl -fsSL https://ollama.com/install.sh | sh
# Comprobar que responde
curl -s http://localhost:11434/api/version
# {"version":"0.32.6"}
Descarga un modelo y prueba:
ollama pull qwen3:8b # 5.2 GB — arranca por aquí
ollama run qwen3:8b "Resume en tres puntos: ..."
Y ya está. Eso es todo lo que hace falta para que ningún dato salga de la máquina.
Elegir modelo
Esta sección caduca rápido, así que va fechada: agosto de 2026. Este es el inventario real de la máquina desde la que escribo, con sus tamaños:
| Modelo | Parámetros | Cuantización | Disco | Para qué lo uso |
|---|---|---|---|---|
glm-4.7-flash | 29.9B | Q4_K_M | 19.0 GB | Razonamiento largo |
gemma4:26b | 25.8B | Q4_K_M | 18.0 GB | Redacción en español |
qwen3.6:27b | 27.8B | Q4_K_M | 17.4 GB | Uso general |
devstral-small-2 | 24.0B | Q4_K_M | 15.2 GB | Código |
gpt-oss:20b | 20.9B | MXFP4 | 13.8 GB | Alternativa rápida |
gemma4:latest | 8.0B | Q4_K_M | 9.6 GB | Tareas cortas |
qwen2.5vl:7b | 8.3B | Q4_K_M | 6.0 GB | Leer imágenes y PDFs escaneados |
qwen3:8b | 8.2B | Q4_K_M | 5.2 GB | El caballo de batalla |
nomic-embed-text | 137M | F16 | 0.3 GB | Embeddings para búsqueda |
No copies esta lista dentro de seis meses. Los nombres cambian cada trimestre; lo que no cambia es el criterio:
- Empieza por un 8B. Resuelve más de lo que la gente supone y arranca en cualquier equipo.
- Sube a 27-30B solo si el 8B se queda corto en tu tarea concreta, no por si acaso.
- Ten un modelo de visión si trabajas con documentos escaneados. En un despacho, la mitad de lo que entra es un PDF fotografiado.
- Ten un modelo de embeddings aparte. Es diminuto y es lo que hace posible buscar en tus documentos.
Y mide el contexto antes de pelearte con él: los modelos locales tienen ventanas más cortas que los de nube, y meter un contrato entero puede no caber.
Que el modelo conozca tus documentos, sin que salgan
Un modelo local sin acceso a tus datos sirve para poco. El patrón es RAG local: partes tus documentos, los conviertes en vectores con un modelo de embeddings, los guardas y recuperas los fragmentos relevantes para cada pregunta.
Todo con nomic-embed-text, que ocupa 300 MB:
curl -s http://localhost:11434/api/embeddings -d '{
"model": "nomic-embed-text",
"prompt": "Cláusula de confidencialidad del contrato de arrendamiento"
}'
Lo importante para este artículo: los embeddings se calculan en tu máquina y el vector se queda en tu disco. No hay una llamada a un servicio externo en ningún punto de la cadena. Ni al indexar, ni al buscar, ni al responder.
Para el almacén de vectores no necesitas montar nada exótico: SQLite con una extensión vectorial basta de sobra para el volumen documental de un despacho.
Los tres errores que se cometen
1. Exponer Ollama a internet
Este es grave y es frecuente. Ollama no trae autenticación. Si lo pones a escuchar en 0.0.0.0 y abres el puerto, cualquiera que encuentre tu IP usa tu GPU — y, peor, ve lo que le preguntas.
Hay gente escaneando internet específicamente en busca de servidores Ollama expuestos. No es hipotético.
# Por defecto escucha solo en local. Déjalo así.
OLLAMA_HOST=127.0.0.1:11434
# ¿Necesitas acceso desde otras máquinas de la oficina?
# Ponlo detrás de un proxy con autenticación, o en una VPN.
# Nunca directo a internet.
Comprueba desde fuera que no responde. Si responde, tienes un problema hoy, no mañana.
2. Creer que local implica cumplir
Ya lo dije arriba y lo repito porque es el malentendido caro: el modelo local elimina la transferencia internacional, no el resto de obligaciones. Sigue haciendo falta el registro de actividades de tratamiento, la base de licitud y avisar de que hay IA de por medio.
3. Meter el modelo más grande que quepa
Un 30B rozando el límite de la VRAM va a tirones y frustra a los usuarios hasta que dejan de usarlo. Un 8B que responde al instante se usa todos los días. La herramienta que se usa gana a la que es mejor sobre el papel.
Cuándo NO montar esto
Por honestidad, porque no siempre compensa:
- Si tus datos no son personales ni confidenciales. Si redactas copy de marketing, el argumento de privacidad no aplica y la nube es mejor y más barata.
- Si necesitas lo último en capacidad. Los modelos abiertos de 27-30B son buenos; no están al nivel de los mejores modelos comerciales en razonamiento difícil. Si tu caso vive de eso, local te va a decepcionar.
- Si no hay nadie que lo mantenga. Un servidor que nadie actualiza es deuda, y con el tiempo un riesgo de seguridad mayor que el problema que resolvía.
- Si el volumen es mínimo. Diez consultas al día no justifican hardware ni mantenimiento.
El caso donde sí compensa es nítido: volumen constante de documentos con datos personales o secreto profesional. Despachos jurídicos, asesorías contables y fiscales, consultas médicas, recursos humanos. Ahí el cálculo sale a favor casi siempre.
Conclusión
El argumento a favor del modelo local no es que la nube sea ilegal — hoy no lo es. Es que la nube te hace depender de una decisión de adecuación que ya se cayó dos veces y está recurrida por tercera, mientras que el modelo local elimina la pregunta entera: si el dato no sale, no hay transferencia que amparar.
Para una PyME o un despacho, el coste de entrada es un equipo con 24 GB de VRAM y una tarde de configuración. A cambio: los datos no salen del edificio, no hay retención de terceros, y no dependes de que un tribunal en Luxemburgo mantenga una decisión de la Comisión.
Lo que no compres es el atajo mental. Local resuelve la transferencia, no el cumplimiento. El registro de actividades hay que escribirlo igual, y al chatbot hay que ponerle el aviso de que es una máquina — aunque la máquina esté en tu propio sótano.