nvidia logo
nvidia

NVIDIA: Nemotron 3 Ultra (free)

NVIDIA Nemotron 3 Ultra is an open frontier-reasoning and orchestration model from NVIDIA, with 55B active parameters out of 550B total (MoE). This model is free to use. 1,000,000 token context window, maximum output of 65,536 tokens. Higher uptime with 5 providers. Includes independent benchmarks from Artificial Analysis.

Panoramica

Specifiche del modello

Contesto
1.000.000 tokens
Output massimo
65.536 tokens
Architettura
text->text
Tokenizer
Other
Limite di conoscenza
Non indicato
Moderato
No
OPENROUTER

Prezzi completi

Tariffe sincronizzate da OpenRouter, per milione di token.

Input
Gratuito
/M tokens
Output
Gratuito
/M tokens
API

Configurazione del modello

Parametri predefiniti

temperature
1
top_p
0.95

Ragionamento

Moderato
No
Parametri predefiniti
high
Capacità e modalità
high, medium
API

Avvio rapido

Chiama questo modello tramite l’API compatibile OpenAI di OpenRouter.

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"nvidia/nemotron-3-ultra-550b-a55b:free","messages":[{"role":"user","content":"Hello!"}]}'
Capacità e modalità

InputOutput

Input
text
Output
text
Ragionamento

· high · medium

API

Parametri API supportati

include_reasoningmax_tokensreasoningreasoning_effortseedtemperaturetool_choicetoolstop_p
Provider disponibili

3 provider

Provider live su OpenRouter

Disponibilità, latenza, throughput e routing cambiano continuamente. Consulta la fonte per i dati correnti.

OpenRouter

DeepInfra

fp4
Contesto
262K
Output massimo
16K
Input
$0.500
Output
$2.20
Lettura cache
$0.100
Scrittura cache
Non indicato

BaseTen

fp4
Contesto
203K
Output massimo
183K
Input
$0.600
Output
$2.40
Lettura cache
$0.120
Scrittura cache
Non indicato

Venice

fp8
Contesto
256K
Output massimo
33K
Input
$0.625
Output
$3.13
Lettura cache
$0.188
Scrittura cache
Non indicato
nvidia

modelli

Tutti i modelli
nvidia logonvidia

NVIDIA: Nemotron 3.5 ASR Streaming Multilingual 0.6B

Nemotron 3.5 ASR Streaming Multilingual 0.6B is a speech recognition model from NVIDIA. Its prompt-conditioned, cache-aware FastConformer-RNNT design targets low-latency transcription across more than 40 languages for real-time captioning, voice...

Contesto
Non indicato
Input
audio
Output
transcription
Input: $3.33Output: Gratuitoper milione di token
Vedi i dettagli del modello
nvidia logonvidia

NVIDIA: Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning is an open mixture-of-experts model from NVIDIA, with 3B active parameters out of 30B total. It is suited for high-throughput agentic workloads and specialized tasks that...

Contesto
262K
Input
text
Output
text
Input: $0.080Output: $0.200per milione di token
Vedi i dettagli del modello
nvidia logonvidia

NVIDIA: Nemotron 3.5 Lightning (free)

NVIDIA Nemotron 3.5 Lightning is an open mixture-of-experts model from NVIDIA, with 3B active parameters out of 30B total. It is suited for high-throughput agentic workloads and specialized tasks that...

Contesto
1M
Input
text
Output
text
Input: GratuitoOutput: Gratuitoper milione di token
Vedi i dettagli del modello
nvidia logonvidia

NVIDIA: Nemotron 3 Embed 1B (free)

NVIDIA Nemotron 3 Embed 1B is an open text embedding model from NVIDIA, optimized for high-throughput, low-latency retrieval. It is suited for enterprise search, RAG, code retrieval, and agentic retrieval...

Contesto
33K
Input
text
Output
embeddings
Input: GratuitoOutput: Gratuitoper milione di token
Vedi i dettagli del modello