z-ai logo
z-ai

Z.ai: GLM 4.6

Descrição da fonte (inglês)

Compared with GLM-4.5, this generation brings several key improvements: Longer context window: The context window has been expanded from 128K to 200K tokens, enabling the model to handle more complex...

Visão geral

Especificações do modelo

Contexto
204.800 tokens
Saída máxima
16.384 tokens
Arquitetura
text->text
Tokenizador
Other
Limite de conhecimento
2025-03-31
Moderado
Não
OPENROUTER

Preços completos

Tarifas sincronizadas do OpenRouter, por milhão de tokens.

Entrada
$0.43
por milhão de tokens
Saída
$1.75
por milhão de tokens
Leitura de cache
$0.08
por milhão de tokens
API

Configuração do modelo

Parâmetros padrão

temperature
0.6

Raciocínio

Raciocínio obrigatório
Não
Parâmetros padrão
Não
API

Início rápido

Defina OPENROUTER_API_KEY localmente. Python requer requests; JavaScript roda em Node.js. Mantenha a chave no servidor.

Documentação da API

curl --fail-with-body https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"z-ai/glm-4.6","messages":[{"role":"user","content":"Hello!"}]}'
Recursos e modalidades

EntradaSaída

Entrada
text
Saída
text
Raciocínio

Não

API

Parâmetros de API compatíveis

frequency_penaltyinclude_reasoninglogit_biasmax_tokensmin_ppresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_p
Provedores disponíveis

4 provedores

Verificado: 20 de setembro de 2026

Provedores ao vivo no OpenRouter

Disponibilidade, latência, throughput e roteamento mudam continuamente. Consulte a fonte para dados atuais.

OpenRouter

Venice

fp4
Contexto
198K
Saída máxima
16K
Entrada
$0.43
Saída
$1.75
Leitura de cache
$0.08
Gravação de cache
Não informado

DeepInfra

fp4
Contexto
203K
Saída máxima
131K
Entrada
$0.5
Saída
$2
Leitura de cache
$0.1
Gravação de cache
Não informado

Novita

bf16
Contexto
205K
Saída máxima
131K
Entrada
$0.55
Saída
$2.2
Leitura de cache
$0.11
Gravação de cache
Não informado

Z.AI

fp4
Contexto
203K
Saída máxima
131K
Entrada
$0.6
Saída
$2.2
Leitura de cache
$0.11
Gravação de cache
Não informado
z-ai

4 modelos

Todos os modelos
z-ai logoz-ai

Z.ai: GLM 5.3 FlashX

GLM-5.3-FlashX is the high-speed variant of Z.ai's GLM-5.3-Flash, a native multimodal model delivering inference speeds of up to 200 tokens/s. Built on the same hybrid sparse and linear attention architecture...

Contexto
1.0M
Entrada
text · image · video
Saída
text
Entrada: $0.37Saída: $1.25por milhão de tokens
Ver detalhes do modelo
z-ai logoz-ai

Z.ai: GLM 5.3 Flash

GLM-5.3-Flash is a native multimodal model from Z.ai. It is suited for efficient coding and long-horizon agent tasks. Its hybrid sparse and linear attention architecture maintains accurate long-context behavior while...

Contexto
1.3M
Entrada
text · image · video
Saída
text
Entrada: $0.15Saída: $0.5por milhão de tokens
Ver detalhes do modelo
z-ai logoz-ai

Z.ai: GLM 5.3 Flash (batch)

GLM-5.3-Flash is a native multimodal model from Z.ai. It is suited for efficient coding and long-horizon agent tasks. Its hybrid sparse and linear attention architecture maintains accurate long-context behavior while...

Contexto
1.0M
Entrada
text · image · video
Saída
text
Entrada: $0.06Saída: $0.2por milhão de tokens
Ver detalhes do modelo
z-ai logoz-ai

Z.ai: GLM 5.3

GLM-5.3 is a large-scale reasoning model from Z.ai, built for complex software engineering and long-horizon agent tasks. It supports text input and output with a 1M-token context window, and improves...

Contexto
1.3M
Entrada
text
Saída
text
Entrada: $0.5614Saída: $1.7644por milhão de tokens
Ver detalhes do modelo