nvidia logo
nvidia

NVIDIA: Nemotron 3 Ultra

NVIDIA Nemotron 3 Ultra is an open frontier-reasoning and orchestration model from NVIDIA, with 55B active parameters out of 550B total (MoE). $0.50 per million input tokens, $2.20 per million output tokens. 262,144 token context window, maximum output of 16,384 tokens. Higher uptime with 5 providers. Includes independent benchmarks from Artificial Analysis.

Przegląd

Specyfikacja modelu

Kontekst
262 144 tokens
Maksymalne wyjście
16 384 tokens
Architektura
text->text
Tokenizer
Other
Granica wiedzy
Brak danych
Moderowany
Nie
OPENROUTER

Pełny cennik

Stawki zsynchronizowane z OpenRouter, za milion tokenów.

Wejście
$0.5
/M tokens
Wyjście
$2.2
/M tokens
Odczyt pamięci podręcznej
$0.1
/M tokens
API

Konfiguracja modelu

Parametry domyślne

temperature
1
top_p
0.95

Rozumowanie

Moderowany
Nie
Parametry domyślne
high
Możliwości i modalności
high, medium
API

Szybki start

Wywołaj ten model przez zgodne z OpenAI API OpenRouter.

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"nvidia/nemotron-3-ultra-550b-a55b","messages":[{"role":"user","content":"Hello!"}]}'
Możliwości i modalności

WejścieWyjście

Wejście
text
Wyjście
text
Rozumowanie

Tak · high · medium

API

Obsługiwane parametry API

frequency_penaltyinclude_reasoninglogit_biasmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_p
Dostępni dostawcy

3 dostawców

Dostawcy na żywo w OpenRouter

Dostępność, opóźnienie, przepustowość i routing stale się zmieniają. Aktualne dane są na stronie źródłowej.

OpenRouter

DeepInfra

fp4
Kontekst
262K
Maksymalne wyjście
16K
Wejście
$0.500
Wyjście
$2.20
Odczyt pamięci podręcznej
$0.100
Zapis pamięci podręcznej
Brak danych

BaseTen

fp4
Kontekst
203K
Maksymalne wyjście
183K
Wejście
$0.600
Wyjście
$2.40
Odczyt pamięci podręcznej
$0.120
Zapis pamięci podręcznej
Brak danych

Venice

fp8
Kontekst
256K
Maksymalne wyjście
33K
Wejście
$0.625
Wyjście
$3.13
Odczyt pamięci podręcznej
$0.188
Zapis pamięci podręcznej
Brak danych
nvidia

modele

Wszystkie modele
nvidia logonvidia

NVIDIA: Nemotron 3.5 ASR Streaming Multilingual 0.6B

Nemotron 3.5 ASR Streaming Multilingual 0.6B is a speech recognition model from NVIDIA. Its prompt-conditioned, cache-aware FastConformer-RNNT design targets low-latency transcription across more than 40 languages for real-time captioning, voice...

Kontekst
Brak danych
Wejście
audio
Wyjście
transcription
Wejście: $3.33Wyjście: Bezpłatnieza milion tokenów
Zobacz szczegóły modelu
nvidia logonvidia

NVIDIA: Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning is an open mixture-of-experts model from NVIDIA, with 3B active parameters out of 30B total. It is suited for high-throughput agentic workloads and specialized tasks that...

Kontekst
262K
Wejście
text
Wyjście
text
Wejście: $0.080Wyjście: $0.200za milion tokenów
Zobacz szczegóły modelu
nvidia logonvidia

NVIDIA: Nemotron 3.5 Lightning (free)

NVIDIA Nemotron 3.5 Lightning is an open mixture-of-experts model from NVIDIA, with 3B active parameters out of 30B total. It is suited for high-throughput agentic workloads and specialized tasks that...

Kontekst
1M
Wejście
text
Wyjście
text
Wejście: BezpłatnieWyjście: Bezpłatnieza milion tokenów
Zobacz szczegóły modelu
nvidia logonvidia

NVIDIA: Nemotron 3 Embed 1B (free)

NVIDIA Nemotron 3 Embed 1B is an open text embedding model from NVIDIA, optimized for high-throughput, low-latency retrieval. It is suited for enterprise search, RAG, code retrieval, and agentic retrieval...

Kontekst
33K
Wejście
text
Wyjście
embeddings
Wejście: BezpłatnieWyjście: Bezpłatnieza milion tokenów
Zobacz szczegóły modelu