La gerencia quiere "nuestro propio ChatGPT". El equipo de datos solicita un servidor con acelerador gráfico antes de haber respondido: qué latencia, qué documentos, quién accede, cuántas solicitudes por día. Tres meses después: dos mil cuatrocientos euros al mes de tarjeta gráfica inactiva, modelo nunca conectado al sistema de información, delegado de protección de datos que descubre que los avisos contienen datos de RRHH.
Alojar un modelo de idioma no es comprar un mapa. Es una cadena: elección de modelo, cuantificación, servicio de inferencia, almacenamiento de incorporaciones, observabilidad, seguridad de las indicaciones. El acelerador de gráficos sólo llega después de este mapeo.
Restricciones que se arreglarán antes del material.
| Pregunta | Por qué es una prioridad |
|---|---|
| Latencia objetivo | Menos de un segundo interactivo → GPU; procesamiento nocturno → procesador posible |
| Tamaño del contexto | Treinta y dos mil tokens multiplican la memoria de vídeo |
| Datos confidenciales | GDPR, confidencialidad médica → región, registros, retención inmediata |
| Volumen de solicitudes | Diez al día vs diez mil cambios de arquitectura |
| Solo ajuste fino o RAG | RAG = base vectorial; ajuste fino = entrenamiento de GPU |
Pila de autohospedaje común
Modelo de pesos abiertos: licencia y uso comercial por verificar. Servidor de inferencia: vLLM, inferencia de generación de texto, llama.cpp según la escala. RAG opcional: PostgreSQL con vectores, Qdrant, incrustaciones separadas. Proxy inverso y autenticación: sin API expuesta sin limitación de velocidad. Registros: las indicaciones pueden contener datos personales; política de retención obligatoria.
Procesador único: Ollama o llama.cpp en servidor de memoria generosa para equipos pequeños. GPU: proporciona margen de contexto; GPU múltiple para más de setenta mil millones de modelos.
API autohospedada versus API administrada
| Criterio | GPU autohospedada | API de la nube |
|---|---|---|
| Privacidad | Control total si se explota bien | Depende del contrato y la región |
| Costo inicial | Alquiler de GPU alta | Facturación por uso bajo |
| Operación | Controladores, actualizaciones de modelos | Mínimo |
| Personalización | Ajuste fino y profundo RAG | Limitado a opciones API |
Para muchas pymes, API europea más autohospedaje RAG (datos en sus instalaciones, inferencias sobre terceros) es el compromiso razonable.
Arriba: la GPU es la última línea de la cita
Compare la región y el tráfico saliente en el directorio antes de firmar un año de alquiler de GPU.
Decide y avanza sin puntos ciegos
Documente el uso, los datos, la latencia y el volumen antes de cualquier compra de hardware. Ejecute una prueba de concepto en CPU o GPU pequeña con modelo cuantificado y métricas reales, no diapositivas. Validar el marco legal: avisos, diarios, subcontratas. Escalable GPU y servicio de inferencia solo si la prueba de concepto tiene usuarios reales.
Preguntas frecuentes
¿Se requiere GPU?
Modelos interactivos y medianos: sí. Procesamiento por lotes o modelo cuantificado pequeño: posible procesador en prueba de concepto.
¿VRAM para 7B?
De cuatro a seis gigabytes cuantificados, catorce con total precisión; Apunta a veinticuatro gigabytes en producción con margen de contexto.
¿Autohospedaje o API?
Datos o volumen confidenciales → RAG autohospedado o híbrido. Time-to-market → API europea.
¿Alojamiento europeo?
Región de la UE, subcontratación, política periodística inmediata, no sólo la bandera.
Antes de elegir una tarjeta, una pregunta: ¿qué pasa si no tenemos una GPU durante dos semanas? Si no tienes una respuesta, no estás listo para albergar un modelo de lenguaje, solo para financiarlo.
