Crea la tua foto parlante AI
Carica un ritratto e il parlato che vuoi. La foto parlante AI ne fa un video in cui quel viso dice ogni parola.
- Basta una sola foto
- Qualsiasi traccia vocale
- Fino a 1080p
- Pagamento al secondo
Ricevi un MP4 lungo quanto il tuo audio. La maggior parte dei clip brevi richiede 3–5 minuti.
Esempio di foto parlante AI
Uno dei nostri test: un solo ritratto e una battuta parlata, trasformati in un video che parla. Attiva l'audio.

La battuta che pronuncia, in inglese: «Hi there. A minute ago this clip was silent. Now every word I say matches my lips.»
Livello Standard · 6,5 s di parlato · 56 crediti · circa 3,5 minuti
Una foto, una battuta, due strade
Abbiamo fatto dire la stessa battuta allo stesso uomo due volte: una con la foto parlante AI, una animando la foto e poi facendo il lip sync.
Foto parlante AI
1 passaggioEntrano foto e audio, esce un video che parla. Un solo passaggio, e testa e viso si muovono con il parlato.
56 crediti
Animare, poi fare il lip sync
2 passaggiPrima un clip muto di 8 secondi dalla foto, poi la bocca ridisegnata sulla battuta. Due passaggi, e scegli il movimento nel primo.
30 + 64 = 94 crediti
Per un singolo ritratto che parla, la foto parlante AI costa meno ed è più semplice. Anima prima la foto se ti serve un movimento preciso, un'inquadratura più lunga o una scena intorno al viso.
Cos'è una foto parlante AI?
Una foto parlante AI è un video creato da un'immagine fissa e da una traccia audio: il viso nella foto apre la bocca, sbatte le palpebre e muove la testa a tempo con il parlato. Le dai un ritratto e una registrazione vocale, e genera ogni fotogramma di quella persona che parla.
Dà un volto a una voce senza telecamera. Un video esplicativo di prodotto, l'intro di un corso, una foto di famiglia o un personaggio AI possono parlare in pochi minuti invece che in una giornata di riprese.
Come funziona la foto parlante AI
Il modello legge l'audio e ricava la forma della bocca per ogni suono, più i piccoli movimenti che accompagnano il parlato: un cenno del capo su una parola accentata, le sopracciglia alzate in una domanda, un battito di ciglia tra una frase e l'altra. Poi disegna ogni fotogramma dalla tua foto, mantenendo uguali viso, capelli e vestiti mentre l'espressione cambia.
Cosa mantiene
L'identità della persona, l'acconciatura, i vestiti, lo sfondo e l'inquadratura della tua foto.
Cosa aggiunge
Movimento delle labbra allineato alle parole, battiti di ciglia naturali, piccoli movimenti di testa e spalle, e il tuo audio come colonna sonora.
Come far parlare una foto in 3 passaggi
Tutta la foto parlante AI avviene nel browser. Nessuna telecamera, nessun software di montaggio.
Carica un ritratto
Un JPG o PNG con un viso rivolto alla camera, di almeno 300 pixel per lato.
Aggiungi il parlato
Una registrazione MP3, WAV, M4A o AAC. Fino a 15 secondi con Standard e HD, 30 secondi con Cinema.
Scegli un livello e anima
Scegli la qualità, spunta la casella del consenso e premi Anima. La maggior parte dei clip brevi è pronta in tre-cinque minuti.
Standard, HD o Cinema: quale livello scegliere
Ogni livello usa la stessa foto e lo stesso audio. Cambiano la nitidezza, la durata massima del parlato e quanto è realistico il movimento.
Standard
8 crediti al secondo
- Output
- 720p
- Audio massimo
- 15 s
Post sui social, bozze e test rapidi. Il nostro esempio qui sopra è Standard.
HD
16 crediti al secondo
- Output
- 1080p
- Audio massimo
- 15 s
Presentatori, pubblicità e tutto ciò che va a schermo intero su un computer.
Cinema
27 crediti al secondo
- Output
- 1080p
- Audio massimo
- 30 s
Discorsi più lunghi, interpretazione espressiva e i movimenti di testa e corpo più realistici.
Cosa rende buona una foto
La foto parlante AI può animare solo ciò che vede. Queste cinque cose fanno la differenza più grande.
Viso verso la camera
Frontale o leggermente girato. Un profilo mostra solo metà bocca.
Perché conta
Il modello ha bisogno di entrambi gli angoli delle labbra per formare ogni parola.
Bocca chiusa e rilassata
Un'espressione neutra o un sorriso leggero lasciano al modello lo spazio per aprire la bocca in modo naturale.
Perché conta
Un sorriso largo o la bocca aperta nella foto vanno contro ogni parola.
Nitida e ben illuminata
Luce uniforme sul viso, niente ombre forti e almeno 300 pixel per lato.
Perché conta
Sono i dettagli intorno a occhi e labbra a rendere credibile il movimento.
Una sola persona
Ritaglia le foto di gruppo lasciando solo il viso che deve parlare.
Perché conta
Con più visi, potrebbe mettersi a parlare quello sbagliato.
Niente davanti al viso
Niente mani, microfoni, occhiali da sole o capelli davanti alla bocca.
Perché conta
I tratti coperti vengono ridisegnati male o per niente.
Come preparare l'audio
Il video dura esattamente quanto il tuo audio, e paghi quei secondi. Un po' di preparazione fa risparmiare crediti.
- 1
Taglia i silenzi
Elimina i secondi muti all'inizio e alla fine. Costano quanto il parlato.
- 2
Una sola voce chiara
Registra in una stanza silenziosa, vicino al microfono. Musica di sottofondo o una seconda voce possono far seguire alle labbra il suono sbagliato.
- 3
Le pause naturali aiutano
Brevi pause tra le frasi danno al viso il tempo di sbattere le palpebre e ricomporsi, e il risultato sembra più umano.
- 4
Funziona con ogni lingua
La bocca segue i suoni, non le parole, quindi va bene qualsiasi lingua parlata o accento.
Avatar parlante AI, lip sync o video con parlato nativo?
Tre modi per avere sullo schermo una persona che dice le tue parole. Scegli in base a ciò da cui parti.
Foto parlante AI
- Parti da
- Una foto, più un audio
- Ideale per
- Presentatori, avatar e personaggi quando non hai riprese
- Attenzione a
- Si muovono solo testa e spalle; lo sfondo resta fermo
Prezzo su Imgveo
40 crediti per 5 s con Standard
Lip sync AI
- Parti da
- Un video, più un audio
- Ideale per
- Doppiaggio e correzione di battute in riprese che hai già
- Attenzione a
- Serve un viso ben visibile nel video
Prezzo su Imgveo
40 crediti per un clip di 5 s
Video con parlato nativo
- Parti da
- Un prompt di testo con il dialogo
- Ideale per
- Scene nuove in cui immagine e voce vengono generate insieme
- Attenzione a
- Non scegli esattamente né il viso né la voce
Prezzo su Imgveo
Da 30 crediti per un clip di 8 s con audio
I prezzi sono presi dal nostro listino in vigore.
Casi d'uso della foto parlante AI
Ovunque un volto lo direbbe meglio di un testo su una slide.
Presentatori e video esplicativi
Dai a una pagina prodotto, a un corso o a un percorso di onboarding un volto amichevole che parla.
Prova così
Usa lo stesso ritratto in ogni video, così il pubblico riconosce il presentatore.
Personaggi AI
Lascia che un personaggio generato si presenti, racconti una storia o risponda a un fan.
Prova così
Genera il personaggio rivolto alla camera con la bocca chiusa, come nel nostro esempio.
Foto di famiglia
Dai vita a un vecchio ritratto con un messaggio registrato da un parente.
Prova così
Scansiona la foto in modo nitido e ritagliala su un solo viso prima di caricarla.
Messaggi multilingue
Registra lo stesso messaggio in più lingue e usa un solo ritratto per tutte.
Prova così
Mantieni le registrazioni di durata simile, così i video risultano coerenti.
Cosa non può fare una foto parlante AI
Limiti onesti, per sapere cosa aspettarti prima di spendere crediti.
Azione a figura intera
Si muovono viso, testa e spalle. Per camminare, gesticolare o muovere la camera serve invece un modello video.
Profili e bocche coperte
Se metà bocca è nascosta, il movimento sembra sbagliato. Usa una foto frontale.
Discorsi molto lunghi
Standard e HD arrivano a 15 secondi, Cinema a 30. Dividi i testi più lunghi in più clip.
Il volto di qualcun altro
Ti serve il diritto di usare il viso e la voce. Blocchiamo i contenuti che violano le nostre regole.
Formati, limiti e prezzi
Cosa accetta la foto parlante AI, cosa restituisce e quanto costa.
Input
Foto: JPG o PNG fino a 10 MB, almeno 300 px, con proporzioni non oltre 2.5 a 1 in larghezza o altezza. Audio: MP3, WAV, M4A o AAC fino a 10 MB.
Output
Un MP4 lungo quanto il tuo audio, con il tuo parlato come colonna sonora, in 720p con Standard e in 1080p con HD e Cinema.
Prezzo
8, 16 o 27 crediti per secondo di audio, arrotondati ai secondi interi. Solo piani a pagamento. Le elaborazioni non riuscite vengono rimborsate.
Prezzo per durata
| Durata dell'audio | Standard | HD | Cinema |
|---|---|---|---|
| 5 s | 40 | 80 | 135 |
| 10 s | 80 | 160 | 270 |
| 15 s | 120 | 240 | 405 |
| 30 s | — | — | 810 |
Consenso e uso responsabile
Una foto parlante può far sembrare che chiunque dica qualsiasi cosa, quindi prima chiediamo il permesso. Prima di ogni elaborazione confermi di avere il diritto di usare il viso e la voce, e ogni foto viene controllata.
- Usa il tuo viso, quello di una persona che ha dato il consenso o un personaggio che hai generato.
- Non far sembrare che personaggi pubblici, minori o privati cittadini dicano cose che non hanno mai detto.
- Segnala i video di foto parlanti come creati con l'AI quando la tua piattaforma lo richiede.
FAQ sulla foto parlante AI
Vuoi tutti i modelli IA in un unico posto?
Apri Imgveo Studio per usare questo e ogni altro modello di video e immagini IA da un unico spazio di lavoro, con un solo saldo di crediti.
Altri strumenti video
Dagli una voce, poi vai oltre.
Lip sync AI
Hai già un video? Sincronizza invece la sua bocca con un nuovo parlato.
Sincronizza un videoDa immagine a video
Anima una foto con movimenti di camera e una scena intorno.
Anima una fotoUpscaler video AI
Porta la tua foto parlante a 2K o 4K per i grandi schermi.
Ingrandisci un videoVeo 3.1
Genera scene nuove con dialoghi e audio integrati.
Prova Veo 3.1Fai parlare la tua foto
Carica un ritratto e una traccia vocale, e la foto parlante AI fa il resto in pochi minuti.