NVIDIA NIM — Inferencia optimizada y microservicios por Gabriel Martínez

Herramientas IA · Infraestructura

NVIDIA NIM:
Inferencia optimizada, lista para usar.

Microservicios de inferencia pre-optimizados por NVIDIA. Desplegá modelos de IA en minutos, no en días.

100+

Modelos disponibles

5 min

Tiempo de deploy

Free

Tier gratuito

16

GPUs self-host

¿Qué es NVIDIA NIM?

El "easy button" de la inferencia de IA

NIM (NVIDIA Inference Microservices) son contenedores Docker pre-optimizados que incluyen: modelo + motor de inferencia (TensorRT-LLM, vLLM o SGLang) + API compatible con OpenAI.

En lugar de configurar todo manualmente, ejecutás un comando Docker y tenés un endpoint de IA listo para producción.

  • Deploy en 1 comando: docker run nvcr.io/nim/...
  • TensorRT-LLM optimizado para GPUs NVIDIA
  • API compatible con OpenAI — migración sin fricción

Código de ejemplo

# 1. Descargás el contenedor
$ docker run -d --gpus all \
  -p 8000:8000 \
  nvcr.io/nim/meta/llama-3.1-70b

# 2. Llamás como OpenAI
from openai import OpenAI

client = OpenAI(
  base_url="http://localhost:8000/v1",
  api_key="not-needed"
)

response = client.chat.completions.create(
  model="meta/llama-3.1-70b",
  messages=[{"role":"user","content":"Hola"}]
)
print(response.choices[0].message.content)

Modelos disponibles

Catálogo NIM (mayo 2026)

Llama 4

Meta · Texto

DeepSeek V4-Pro

DeepSeek · Texto

Qwen 3

Alibaba · Texto

Kimi K2.5

Moonshot · Texto

Nemotron 3

NVIDIA · Texto/Multimodal

Whisper Large v3

OpenAI · Speech

¿Listo para desplegar?

Empezá gratis con NVIDIA NIM

1,000 créditos de inferencia gratis al registrarte. 40 requests/minuto para prototipar.

Registrarme gratis

¿Querés implementar NVIDIA NIM?

Escribime por WhatsApp y te ayudo a elegir la mejor opción para tu proyecto.

Consultar por WhatsApp