microsoft logo
microsoft

Microsoft: MAI-Voice-2

MAI-Voice-2 is an expressive text-to-speech model from Microsoft. Priced at $22 per M characters. 0 token context window. Includes independent benchmarks from Artificial Analysis.

Panoramica

Specifiche del modello

Contesto
Non indicato
Output massimo
Non indicato
Architettura
text->speech
Tokenizer
Other
Limite di conoscenza
Non indicato
Moderato
No
OPENROUTER

Prezzi completi

Tariffe sincronizzate da OpenRouter, per milione di token.

Characters
$22
/M characters
API

Configurazione del modello

Voci supportate

en-US-Harper:MAI-Voice-2es-MX-Valeria:MAI-Voice-2fr-FR-Soleil:MAI-Voice-2de-DE-Klaus:MAI-Voice-2
API

Avvio rapido

Chiama questo modello tramite l’API compatibile OpenAI di OpenRouter.

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"microsoft/mai-voice-2","messages":[{"role":"user","content":"Hello!"}]}'
Capacità e modalità

InputOutput

Input
text
Output
speech
API

Parametri API supportati

max_completion_tokensmax_tokenstemperaturetop_p
Provider disponibili

1 Provider

Provider live su OpenRouter

Disponibilità, latenza, throughput e routing cambiano continuamente. Consulta la fonte per i dati correnti.

OpenRouter

Azure

unknown
Contesto
Non indicato
Output massimo
Non indicato
Input
$22.00
Output
Gratuito
Lettura cache
Non indicato
Scrittura cache
Non indicato
microsoft

modelli

Tutti i modelli
microsoft logomicrosoft

Microsoft: MAI-Image-2.5 Pro

Microsoft's MAI-Image-2.5 is a high-quality image generation model available via Azure AI Foundry. It produces photorealistic and artistic images from text prompts with support for various aspect ratios.

Contesto
4K
Input
text · image
Output
image
Input: $5.00Output: Gratuitoper milione di token
Vedi i dettagli del modello
microsoft logomicrosoft

Microsoft: MAI-Voice-2-Flash

MAI-Voice-2-Flash is a low-latency text-to-speech model from Microsoft for voice agents, assistants, call centers, accessibility, narration, and other interactive applications. It generates expressive 24 kHz mono speech across 15 languages...

Contesto
Non indicato
Input
text
Output
speech
Input: $15.00Output: Gratuitoper milione di token
Vedi i dettagli del modello
microsoft logomicrosoft

Microsoft: MAI-Transcribe 1.5

MAI-Transcribe 1.5 is a multilingual speech-to-text model from Microsoft AI. It is suited for captions, call transcription, subtitling, accessibility, and other voice-enabled applications, with reliable transcription across 43 languages, diverse...

Contesto
Non indicato
Input
audio
Output
transcription
Input: $360000.00Output: Gratuitoper milione di token
Vedi i dettagli del modello
microsoft logomicrosoft

Microsoft: MAI-Image-2.5

Microsoft's MAI-Image-2.5 is a high-quality image generation model available via Azure AI Foundry. It produces photorealistic and artistic images from text prompts with support for various aspect ratios.

Contesto
4K
Input
text · image
Output
image
Input: $5.00Output: Gratuitoper milione di token
Vedi i dettagli del modello