inclusionai logo
inclusionai

Ling-3.0-flash

Ling-3.0-flash is a 124B-parameter Mixture-of-Experts (MoE) model, with approximately 5.1B parameters activated per token. The model is designed with token efficiency and production-scale agentic inference as key priorities, enabling developers...

Overview

Model specifications

Context
262,144 tokens
Maximum output
32,768 tokens
Architecture
text->text
Tokenizer
Other
Knowledge cutoff
Not provided
Moderated
No
Capabilities

InputOutput

Input
text
Output
text
Reasoning

Yes

API

Supported API parameters

frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningrepetition_penaltyresponse_formatseedstoptemperaturetool_choicetoolstop_ktop_logprobstop_p
Available providers

2 providers

Novita

unknown
Context
262K
Maximum output
33K
Input
$0.021
Output
$0.063
Cache read
$0.0042
Cache write
Not provided

DeepInfra

bf16
Context
131K
Maximum output
33K
Input
$0.060
Output
$0.180
Cache read
$0.012
Cache write
Not provided
inclusionai

models

All models