microsoft logo
microsoft

Microsoft AI: MAI-Voice-2

Descrizione della fonte (inglese)

MAI-Voice-2 is an expressive text-to-speech model from Microsoft AI. It is suited for conversational assistants, media narration, accessibility, education, and other long-form voice applications. It supports 15 languages across 18...

Panoramica

Specifiche del modello

Contesto
Non indicato
Output massimo
Non indicato
Architettura
text->speech
Tokenizer
Other
Limite di conoscenza
Non indicato
Moderato
No
OPENROUTER

Prezzi completi

Tariffe sincronizzate da OpenRouter, per milione di token.

Caratteri
$22
per milione di caratteri
API

Configurazione del modello

Voci supportate

en-US-Harper:MAI-Voice-2es-MX-Valeria:MAI-Voice-2fr-FR-Soleil:MAI-Voice-2de-DE-Klaus:MAI-Voice-2
API

Avvio rapido

Imposta OPENROUTER_API_KEY localmente. Python richiede requests; JavaScript viene eseguito in Node.js. Conserva la chiave sul server.

Scegli una voce supportata. Sostituisci YOUR_VOICE_ID se non sono elencate voci.

Documentazione API

curl --fail-with-body https://openrouter.ai/api/v1/audio/speech \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"microsoft/mai-voice-2","input":"Hello!","voice":"en-US-Harper:MAI-Voice-2","response_format":"mp3"}' \
  --output speech.mp3
Capacità e modalità

InputOutput

Input
text
Output
speech
API

Parametri API supportati

Provider disponibili

1 Provider

Verificato: 16 settembre 2026

Provider live su OpenRouter

Disponibilità, latenza, throughput e routing cambiano continuamente. Consulta la fonte per i dati correnti.

OpenRouter

Azure

Non indicato
Contesto
Non indicato
Output massimo
Non indicato
microsoft

4 modelli

Tutti i modelli
microsoft logomicrosoft

Microsoft AI: MAI-Image-2.6

MAI-Image-2.6 is an image generation and editing model from Microsoft AI, the precision tier of the MAI-Image-2.6 family alongside the faster MAI-Image-2.6 Flash. It is suited for design-ready visuals and...

Contesto
4K
Input
text · image
Output
image
Input: $5 per milione di tokenOutput immagine: $38 per milione di token
Vedi i dettagli del modello
microsoft logomicrosoft

Microsoft AI: MAI-Image-2.6 Flash

MAI-Image-2.6 Flash is the lower-latency, lower-cost member of the MAI-Image-2.6 family from Microsoft AI, built for latency-sensitive, high-throughput production image generation and editing at comparable quality to the precision tier....

Contesto
4K
Input
text · image
Output
image
Input: $1.75 per milione di tokenOutput immagine: $19 per milione di token
Vedi i dettagli del modello
microsoft logomicrosoft

Microsoft AI: MAI-Transcribe 2

MAI-Transcribe 2 is a multilingual speech-to-text model from Microsoft AI, ranked #1 on the FLEURS multilingual benchmark. It supports 60 languages with automatic language identification, code switching for mixed-language speech,...

Contesto
Non indicato
Input
audio
Output
transcription
Durata audio: $0.1 all’ora
Vedi i dettagli del modello
microsoft logomicrosoft

Microsoft AI: MAI-Image-2.5 Pro

Microsoft AI's MAI-Image-2.5 is a high-quality image generation model available via Azure AI Foundry. It produces photorealistic and artistic images from text prompts with support for various aspect ratios.

Contesto
4K
Input
text · image
Output
image
Input: $5 per milione di tokenOutput immagine: $108 per milione di token
Vedi i dettagli del modello