La pregunta correcta empieza por el modelo y la carga
Un PC para IA local no se diseña preguntando qué compra todo el mundo. Hay que saber qué modelos quieres ejecutar, con qué cuantización, longitud de contexto y concurrencia, cuánto valor tiene la privacidad y cuánto cuesta esperar.
La GPU suele marcar el límite, pero la plataforma completa determina si la máquina puede sostener el trabajo sin problemas de memoria, temperatura, almacenamiento o expansión.
VRAM antes que una cifra de benchmark
La VRAM decide qué parte del modelo, caché y contexto puede permanecer en GPU. Una GeForce RTX 5090 con 32 GB puede ser una base excepcional para una estación personal de inferencia, ComfyUI, desarrollo, creación y prototipos privados.
Una RTX PRO 6000 Blackwell con 96 GB GDDR7 ECC cambia la escala del proyecto. Permite alojar modelos, contextos y escenas que no caben en una GPU de consumo, además de ofrecer funciones y soporte orientados a trabajo profesional.
No existe una equivalencia universal entre “70B” y una cantidad fija de VRAM. El resultado depende de cuantización, contexto, backend, caché KV, concurrencia y cuánto trabajo se descarga a RAM o CPU.
Tres niveles de arquitectura razonables
Estación personal con una GPU extrema
Una plataforma AM5 moderna, RTX 5090 de 32 GB, 64 o 128 GB de RAM y NVMe rápido puede ser adecuada para un desarrollador, creador o pequeño estudio. Es potente, relativamente compacta y también puede cubrir gaming o producción.
Workstation profesional de gran memoria
Cuando el proyecto necesita 96 GB de VRAM, ECC, carga sostenida o mayor previsibilidad, RTX PRO 6000 Blackwell entra en otra categoría. La versión Max-Q ofrece 96 GB en formato dual-slot y 300 W, algo especialmente interesante para densidad, calor y acústica.
Plataforma expandible o multi-GPU
Para más líneas PCIe, memoria ECC Registered y expansión seria, Threadripper PRO 9000 WX sobre WRX90 ofrece ocho canales de memoria y una plataforma pensada para workstation. No debe elegirse solo por prestigio: tiene sentido cuando el flujo realmente utiliza esa capacidad.
Cuánta RAM necesita una workstation de IA
Para una estación personal bien enfocada, 64 GB pueden ser suficientes. 128 GB ofrecen un margen mucho más cómodo para modelos descargados parcialmente a CPU, datasets, varias herramientas, máquinas virtuales y creación.
En una workstation profesional, 256 GB o más pueden tener sentido, especialmente con Threadripper PRO, varios usuarios, gran contexto o cargas que mezclan inferencia, indexación y procesamiento de datos. La capacidad debe validarse junto con el número de canales y los módulos compatibles.
Almacenamiento: sistema, modelos y trabajo activo
Los modelos ocupan espacio y cambian con rapidez. Una arquitectura seria puede separar:
NVMe para sistema, herramientas y scratch.
NVMe de mayor capacidad para modelos y cachés.
Volumen adicional para datasets, proyectos y copias locales.
No elegimos un SSD únicamente por su lectura secuencial. También importan capacidad sostenida, temperatura, resistencia, firmware y estrategia de copia de seguridad.
CPU y plataforma
La CPU no compensa una GPU con poca memoria, pero sí afecta ingestión, compilación, preparación de datos, herramientas paralelas y tareas descargadas a RAM. Para una GPU, una plataforma de escritorio de alta gama puede ser suficiente. Para varias GPUs, mucha memoria o E/S profesional, TRX50 o WRX90 deben estudiarse desde el principio.
Refrigeración, potencia y funcionamiento continuo
Inferencia prolongada no se parece a un benchmark breve. La caja, separación de GPU, presión de aire, conectores, fuente y temperatura ambiente deben dimensionarse para carga real.
Una fuente con potencia nominal suficiente puede seguir siendo incorrecta si no dispone del cableado, margen térmico o conectores adecuados. En sistemas profesionales validamos también ruido, ubicación y posibilidad de ampliación.
Sistema operativo y software
Ubuntu 26.04 LTS y Ubuntu 24.04 LTS forman parte de las plataformas soportadas por las versiones actuales de CUDA, pero el sistema final debe validarse contra el driver, framework y contenedores del proyecto.
Ollama, llama.cpp, vLLM, SGLang, PyTorch y ComfyUI no exigen exactamente lo mismo. Conviene definir el backend antes de congelar la arquitectura.
Nuestra recomendación
No compres una lista fija. Define modelos, contexto, usuarios, disponibilidad esperada, ruido, espacio, electricidad y presupuesto. Después valida hardware, software, stock y garantía como un solo sistema.
Para una estación personal, revisa Neural Nexus. Para más memoria o expansión, consulta TensorForge. También puedes solicitar una propuesta validada.

















