Crea la tua foto parlante AI

Carica un ritratto e il parlato che vuoi. La foto parlante AI ne fa un video in cui quel viso dice ogni parola.

  • Basta una sola foto
  • Qualsiasi traccia vocale
  • Fino a 1080p
  • Pagamento al secondo
720p · 8/s

Ricevi un MP4 lungo quanto il tuo audio. La maggior parte dei clip brevi richiede 3–5 minuti.

Esempio di foto parlante AI

Uno dei nostri test: un solo ritratto e una battuta parlata, trasformati in un video che parla. Attiva l'audio.

Il ritratto generato con l'AI da cui è stata creata la foto parlante
La foto
La foto parlante

La battuta che pronuncia, in inglese: «Hi there. A minute ago this clip was silent. Now every word I say matches my lips.»

Livello Standard · 6,5 s di parlato · 56 crediti · circa 3,5 minuti

Una foto, una battuta, due strade

Abbiamo fatto dire la stessa battuta allo stesso uomo due volte: una con la foto parlante AI, una animando la foto e poi facendo il lip sync.

Foto parlante AI

1 passaggio

Entrano foto e audio, esce un video che parla. Un solo passaggio, e testa e viso si muovono con il parlato.

56 crediti

Animare, poi fare il lip sync

2 passaggi

Prima un clip muto di 8 secondi dalla foto, poi la bocca ridisegnata sulla battuta. Due passaggi, e scegli il movimento nel primo.

30 + 64 = 94 crediti

Per un singolo ritratto che parla, la foto parlante AI costa meno ed è più semplice. Anima prima la foto se ti serve un movimento preciso, un'inquadratura più lunga o una scena intorno al viso.

Cos'è una foto parlante AI?

Una foto parlante AI è un video creato da un'immagine fissa e da una traccia audio: il viso nella foto apre la bocca, sbatte le palpebre e muove la testa a tempo con il parlato. Le dai un ritratto e una registrazione vocale, e genera ogni fotogramma di quella persona che parla.

Dà un volto a una voce senza telecamera. Un video esplicativo di prodotto, l'intro di un corso, una foto di famiglia o un personaggio AI possono parlare in pochi minuti invece che in una giornata di riprese.

Come funziona la foto parlante AI

Il modello legge l'audio e ricava la forma della bocca per ogni suono, più i piccoli movimenti che accompagnano il parlato: un cenno del capo su una parola accentata, le sopracciglia alzate in una domanda, un battito di ciglia tra una frase e l'altra. Poi disegna ogni fotogramma dalla tua foto, mantenendo uguali viso, capelli e vestiti mentre l'espressione cambia.

Cosa mantiene

L'identità della persona, l'acconciatura, i vestiti, lo sfondo e l'inquadratura della tua foto.

Cosa aggiunge

Movimento delle labbra allineato alle parole, battiti di ciglia naturali, piccoli movimenti di testa e spalle, e il tuo audio come colonna sonora.

Come far parlare una foto in 3 passaggi

Tutta la foto parlante AI avviene nel browser. Nessuna telecamera, nessun software di montaggio.

01

Carica un ritratto

Un JPG o PNG con un viso rivolto alla camera, di almeno 300 pixel per lato.

02

Aggiungi il parlato

Una registrazione MP3, WAV, M4A o AAC. Fino a 15 secondi con Standard e HD, 30 secondi con Cinema.

MP4
03

Scegli un livello e anima

Scegli la qualità, spunta la casella del consenso e premi Anima. La maggior parte dei clip brevi è pronta in tre-cinque minuti.

Standard, HD o Cinema: quale livello scegliere

Ogni livello usa la stessa foto e lo stesso audio. Cambiano la nitidezza, la durata massima del parlato e quanto è realistico il movimento.

Standard

8 crediti al secondo

Output
720p
Audio massimo
15 s

Post sui social, bozze e test rapidi. Il nostro esempio qui sopra è Standard.

HD

16 crediti al secondo

Output
1080p
Audio massimo
15 s

Presentatori, pubblicità e tutto ciò che va a schermo intero su un computer.

Cinema

27 crediti al secondo

Output
1080p
Audio massimo
30 s

Discorsi più lunghi, interpretazione espressiva e i movimenti di testa e corpo più realistici.

Cosa rende buona una foto

La foto parlante AI può animare solo ciò che vede. Queste cinque cose fanno la differenza più grande.

01

Viso verso la camera

Frontale o leggermente girato. Un profilo mostra solo metà bocca.

Perché conta

Il modello ha bisogno di entrambi gli angoli delle labbra per formare ogni parola.

02

Bocca chiusa e rilassata

Un'espressione neutra o un sorriso leggero lasciano al modello lo spazio per aprire la bocca in modo naturale.

Perché conta

Un sorriso largo o la bocca aperta nella foto vanno contro ogni parola.

03

Nitida e ben illuminata

Luce uniforme sul viso, niente ombre forti e almeno 300 pixel per lato.

Perché conta

Sono i dettagli intorno a occhi e labbra a rendere credibile il movimento.

04

Una sola persona

Ritaglia le foto di gruppo lasciando solo il viso che deve parlare.

Perché conta

Con più visi, potrebbe mettersi a parlare quello sbagliato.

05

Niente davanti al viso

Niente mani, microfoni, occhiali da sole o capelli davanti alla bocca.

Perché conta

I tratti coperti vengono ridisegnati male o per niente.

Come preparare l'audio

Il video dura esattamente quanto il tuo audio, e paghi quei secondi. Un po' di preparazione fa risparmiare crediti.

  1. 1

    Taglia i silenzi

    Elimina i secondi muti all'inizio e alla fine. Costano quanto il parlato.

  2. 2

    Una sola voce chiara

    Registra in una stanza silenziosa, vicino al microfono. Musica di sottofondo o una seconda voce possono far seguire alle labbra il suono sbagliato.

  3. 3

    Le pause naturali aiutano

    Brevi pause tra le frasi danno al viso il tempo di sbattere le palpebre e ricomporsi, e il risultato sembra più umano.

  4. 4

    Funziona con ogni lingua

    La bocca segue i suoni, non le parole, quindi va bene qualsiasi lingua parlata o accento.

Avatar parlante AI, lip sync o video con parlato nativo?

Tre modi per avere sullo schermo una persona che dice le tue parole. Scegli in base a ciò da cui parti.

Foto parlante AI

Parti da
Una foto, più un audio
Ideale per
Presentatori, avatar e personaggi quando non hai riprese
Attenzione a
Si muovono solo testa e spalle; lo sfondo resta fermo

Prezzo su Imgveo

40 crediti per 5 s con Standard

Lip sync AI

Parti da
Un video, più un audio
Ideale per
Doppiaggio e correzione di battute in riprese che hai già
Attenzione a
Serve un viso ben visibile nel video

Prezzo su Imgveo

40 crediti per un clip di 5 s

Video con parlato nativo

Parti da
Un prompt di testo con il dialogo
Ideale per
Scene nuove in cui immagine e voce vengono generate insieme
Attenzione a
Non scegli esattamente né il viso né la voce

Prezzo su Imgveo

Da 30 crediti per un clip di 8 s con audio

I prezzi sono presi dal nostro listino in vigore.

Casi d'uso della foto parlante AI

Ovunque un volto lo direbbe meglio di un testo su una slide.

01

Presentatori e video esplicativi

Dai a una pagina prodotto, a un corso o a un percorso di onboarding un volto amichevole che parla.

Prova così

Usa lo stesso ritratto in ogni video, così il pubblico riconosce il presentatore.

02

Personaggi AI

Lascia che un personaggio generato si presenti, racconti una storia o risponda a un fan.

Prova così

Genera il personaggio rivolto alla camera con la bocca chiusa, come nel nostro esempio.

03

Foto di famiglia

Dai vita a un vecchio ritratto con un messaggio registrato da un parente.

Prova così

Scansiona la foto in modo nitido e ritagliala su un solo viso prima di caricarla.

04

Messaggi multilingue

Registra lo stesso messaggio in più lingue e usa un solo ritratto per tutte.

Prova così

Mantieni le registrazioni di durata simile, così i video risultano coerenti.

Cosa non può fare una foto parlante AI

Limiti onesti, per sapere cosa aspettarti prima di spendere crediti.

Azione a figura intera

Si muovono viso, testa e spalle. Per camminare, gesticolare o muovere la camera serve invece un modello video.

Profili e bocche coperte

Se metà bocca è nascosta, il movimento sembra sbagliato. Usa una foto frontale.

Discorsi molto lunghi

Standard e HD arrivano a 15 secondi, Cinema a 30. Dividi i testi più lunghi in più clip.

Il volto di qualcun altro

Ti serve il diritto di usare il viso e la voce. Blocchiamo i contenuti che violano le nostre regole.

Formati, limiti e prezzi

Cosa accetta la foto parlante AI, cosa restituisce e quanto costa.

Input

Foto: JPG o PNG fino a 10 MB, almeno 300 px, con proporzioni non oltre 2.5 a 1 in larghezza o altezza. Audio: MP3, WAV, M4A o AAC fino a 10 MB.

Output

Un MP4 lungo quanto il tuo audio, con il tuo parlato come colonna sonora, in 720p con Standard e in 1080p con HD e Cinema.

Prezzo

8, 16 o 27 crediti per secondo di audio, arrotondati ai secondi interi. Solo piani a pagamento. Le elaborazioni non riuscite vengono rimborsate.

Prezzo per durata

Durata dell'audioStandardHDCinema
5 s4080135
10 s80160270
15 s120240405
30 s——810

Consenso e uso responsabile

Una foto parlante può far sembrare che chiunque dica qualsiasi cosa, quindi prima chiediamo il permesso. Prima di ogni elaborazione confermi di avere il diritto di usare il viso e la voce, e ogni foto viene controllata.

  • Usa il tuo viso, quello di una persona che ha dato il consenso o un personaggio che hai generato.
  • Non far sembrare che personaggi pubblici, minori o privati cittadini dicano cose che non hanno mai detto.
  • Segnala i video di foto parlanti come creati con l'AI quando la tua piattaforma lo richiede.

FAQ sulla foto parlante AI

Vuoi tutti i modelli IA in un unico posto?

Apri Imgveo Studio per usare questo e ogni altro modello di video e immagini IA da un unico spazio di lavoro, con un solo saldo di crediti.

Apri in Studio

Altri strumenti video

Dagli una voce, poi vai oltre.

Fai parlare la tua foto

Carica un ritratto e una traccia vocale, e la foto parlante AI fa il resto in pochi minuti.