nvidia logo
nvidia

NVIDIA: Nemotron 3 Ultra (free)

NVIDIA Nemotron 3 Ultra is an open frontier-reasoning and orchestration model from NVIDIA, with 55B active parameters out of 550B total (MoE). This model is free to use. 1,000,000 token context window, maximum output of 65,536 tokens. Higher uptime with 5 providers. Includes independent benchmarks from Artificial Analysis.

Visão geral

Especificações do modelo

Contexto
1.000.000 tokens
Saída máxima
65.536 tokens
Arquitetura
text->text
Tokenizador
Other
Limite de conhecimento
Não informado
Moderado
Não
OPENROUTER

Preços completos

Tarifas sincronizadas do OpenRouter, por milhão de tokens.

Entrada
Grátis
/M tokens
Saída
Grátis
/M tokens
API

Configuração do modelo

Parâmetros padrão

temperature
1
top_p
0.95

Raciocínio

Moderado
Não
Parâmetros padrão
high
Recursos e modalidades
high, medium
API

Início rápido

Use este modelo pela API compatível com OpenAI do OpenRouter.

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"nvidia/nemotron-3-ultra-550b-a55b:free","messages":[{"role":"user","content":"Hello!"}]}'
Recursos e modalidades

EntradaSaída

Entrada
text
Saída
text
Raciocínio

Sim · high · medium

API

Parâmetros de API compatíveis

include_reasoningmax_tokensreasoningreasoning_effortseedtemperaturetool_choicetoolstop_p
Provedores disponíveis

3 provedores

Provedores ao vivo no OpenRouter

Disponibilidade, latência, throughput e roteamento mudam continuamente. Consulte a fonte para dados atuais.

OpenRouter

DeepInfra

fp4
Contexto
262K
Saída máxima
16K
Entrada
$0.500
Saída
$2.20
Leitura de cache
$0.100
Gravação de cache
Não informado

BaseTen

fp4
Contexto
203K
Saída máxima
183K
Entrada
$0.600
Saída
$2.40
Leitura de cache
$0.120
Gravação de cache
Não informado

Venice

fp8
Contexto
256K
Saída máxima
33K
Entrada
$0.625
Saída
$3.13
Leitura de cache
$0.188
Gravação de cache
Não informado
nvidia

modelos

Todos os modelos
nvidia logonvidia

NVIDIA: Nemotron 3.5 ASR Streaming Multilingual 0.6B

Nemotron 3.5 ASR Streaming Multilingual 0.6B is a speech recognition model from NVIDIA. Its prompt-conditioned, cache-aware FastConformer-RNNT design targets low-latency transcription across more than 40 languages for real-time captioning, voice...

Contexto
Não informado
Entrada
audio
Saída
transcription
Entrada: $3.33Saída: Grátispor milhão de tokens
Ver detalhes do modelo
nvidia logonvidia

NVIDIA: Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning is an open mixture-of-experts model from NVIDIA, with 3B active parameters out of 30B total. It is suited for high-throughput agentic workloads and specialized tasks that...

Contexto
262K
Entrada
text
Saída
text
Entrada: $0.080Saída: $0.200por milhão de tokens
Ver detalhes do modelo
nvidia logonvidia

NVIDIA: Nemotron 3.5 Lightning (free)

NVIDIA Nemotron 3.5 Lightning is an open mixture-of-experts model from NVIDIA, with 3B active parameters out of 30B total. It is suited for high-throughput agentic workloads and specialized tasks that...

Contexto
1M
Entrada
text
Saída
text
Entrada: GrátisSaída: Grátispor milhão de tokens
Ver detalhes do modelo
nvidia logonvidia

NVIDIA: Nemotron 3 Embed 1B (free)

NVIDIA Nemotron 3 Embed 1B is an open text embedding model from NVIDIA, optimized for high-throughput, low-latency retrieval. It is suited for enterprise search, RAG, code retrieval, and agentic retrieval...

Contexto
33K
Entrada
text
Saída
embeddings
Entrada: GrátisSaída: Grátispor milhão de tokens
Ver detalhes do modelo