AIMHUBAIMHUBby Federico Cavallini
Tutti gli articoliAI & Video

Come creare video con l'intelligenza artificiale: la guida completa (con il mio prompt)

6 luglio 20269 min di letturadi Cava

Hai presente il video della proposta di matrimonio in cima all'Empire State Building? Quello vero, della Daredevil Couple, diventato virale a luglio 2026.

Io l'ho rifatto con l'intelligenza artificiale. Ambientato sulla Torre di Pisa. Zero riprese, zero attori, zero permessi. Solo modelli AI e un prompt scritto bene.

In questo articolo ti spiego esattamente come: i modelli che uso, il procedimento passo passo e il prompt completo che puoi copiare e riadattare al tuo caso. Niente teoria, solo il metodo che ho applicato davvero.

Il video che ho creato con questo procedimento. Zero riprese, zero attori: solo AI.

Come si crea un video con l'AI, in breve

Per creare un video con l'intelligenza artificiale nel 2026 servono tre cose: un modello di immagini (come Nano Banana 2 o GPT Image 2) per generare il frame di partenza, un modello video (come Seedance 2.0 o Kling 3) per animarlo, e un prompt strutturato che descrive look, scena, azione e movimenti di camera. Il flusso è: immagine statica → prompt di animazione → video finale.

Questa è la risposta rapida. Adesso vediamo ogni pezzo nel dettaglio.

I migliori modelli AI per creare video nel 2026

Ne ho provati parecchi. Questi due sono quelli che oggi valgono davvero il tuo tempo:

Seedance 2.0 (ByteDance)

Il modello che ho usato per il mio video. Il suo punto forte è l'image-to-video con reference multiple: gli dai un frame di partenza più immagini di riferimento per personaggi, oggetti e composizione, e lui mantiene tutto coerente per l'intera clip. Gestisce shot continui fino a 15 secondi con movimenti di camera complessi — crane, orbit, pullback — descritti a parole. Per video con personaggi che devono restare riconoscibili dall'inizio alla fine, oggi è il riferimento.

Kling 3

L'alternativa di punta. Eccellente resa del movimento umano e della fisica (stoffe, capelli, acqua), ottimo realismo generale. Lo preferisco quando il video punta tutto sulla naturalezza del movimento e non servono troppe reference di identità. Tra Kling 3 e Seedance 2.0 non c'è un vincitore assoluto: dipende dal tipo di scena.

I migliori modelli AI per le immagini di partenza

Il video parte sempre da un'immagine. E la qualità di quell'immagine decide la qualità del video. I due modelli che uso:

Nano Banana 2 (Google)

Il mio standard per gli still fotorealistici: frame di partenza, character sheet dei personaggi, reference di scena. Segue prompt lunghi e dettagliati senza perdersi i pezzi, e gestisce bene le immagini di riferimento allegate. Tutto il materiale visivo del mio video è nato qui.

GPT Image 2 (OpenAI / ChatGPT)

Il modello immagini di ChatGPT. Il suo punto forte è la tipografia: testi dentro le immagini, thumbnail, grafiche con scritte leggibili. Per i frame cinematografici preferisco Nano Banana 2, ma quando serve testo nell'immagine, GPT Image 2 vince.

Il procedimento: come ho creato il mio video, passo passo

Il metodo arriva dal workflow di un creator che ha ricreato lo stesso video virale (wedjo.studio — trovi il breakdown originale online). Io l'ho seguito e riadattato. Quattro fasi:

1. Crea i character sheet

Prima dei video, i personaggi. Genera un'immagine di riferimento per ogni personaggio — e se nel video c'è un "reveal" (una maschera che si toglie, per esempio), ti servono entrambe le versioni: mascherato e non, chiaramente la stessa persona. Regola d'oro: ogni immagine di riferimento deve avere UN compito preciso, dichiarato nel prompt. "L'immagine 1 controlla il volto, l'immagine 2 controlla i vestiti". Mai scrivere "usa le reference" e basta.

2. Definisci il look (e sporcalo)

Il mio primo tentativo sembrava troppo bello. Cinematografico = finto, per questo tipo di contenuto. Il trucco è descrivere il look come una trasmissione degradata, non come uno stile: "raw amateur news helicopter footage", compressione video, colori slavati, motion blur, luce sovraesposta. Se l'immagine è bella, è sbagliata. Le imperfezioni vendono il realismo più di qualsiasi color grading.

3. Genera lo start frame

Lo start frame fa due lavori: apre il video E definisce l'intero look. Genera still con Nano Banana 2 finché uno non "siede" — poi nel prompt video non descrivi più il look, punti solo al frame. Questo è il passaggio che quasi tutti saltano, ed è il motivo per cui i loro video AI cambiano aspetto a metà clip.

4. Anima con Seedance 2.0

Ora il prompt video. Struttura fissa, a blocchi: LOOK (punta allo start frame), REFERENCES (ogni immagine col suo compito), SCENE (cosa c'è nell'inquadratura), ACTION (cosa succede, secondo per secondo), CAMERA (il movimento, secondo per secondo), AUDIO e CONSTRAINTS (cosa NON deve succedere). Quindici secondi, una sola inquadratura, nessun taglio.

Il prompt completo (copialo e riadattalo)

Questo è il prompt esatto che ho dato a Seedance 2.0 per il mio video. Copialo col bottone qui sotto e riadatta scena, personaggi e location al tuo caso. Le parti tra parentesi quadre sono le immagini di riferimento: sostituiscile con le tue.

Prompt Seedance 2.0 — video 9:16, 15 secondi

Copialo e riadatta scena, personaggi e reference.

One continuous 15-second shot, 9:16, no cuts.

LOOK: The start frame defines the entire visual identity of this video — its hazy overexposed midday light, washed low-contrast news-footage color, soft degraded video texture, telephoto compression and grain stay EXACTLY the same from first frame to last. Never drift toward a cinematic or graded look. The opening may evolve freely from the start frame — it is the look anchor and starting point, not a locked keyframe.

REFERENCES: The start frame controls the look and the approximate opening composition. Reference image [REFERENCE VOLTO UOMO] controls the man's identity, unmasked face. Reference image [REFERENCE VOLTO DONNA] controls the woman's identity. Reference image [REFERENCE COMPOSIZIONE FINALE] is a COMPOSITION GUIDE ONLY for the final wide framing — take from it the flag's position at the very top of the antenna mast and the overall sense of scale; do NOT copy it 1:1. The flag hangs at the very top of the mast for the entire video and only becomes readable as the camera pulls wide.

SCENE: Top platform of the tower antenna spire, as in the start frame: a medium-wide framing from ~35° above. The two figures read relatively small on the deck: he kneels with a small open ring box, she stands facing him, hands at her mouth. The background already carries directional motion blur — the camera is in motion from the very first frame.

ACTION:

Seconds 0–3: Exactly from the start frame pose — he holds the open ring box up, she freezes, hands pressed to her balaclava. She nods twice, small and involuntary.

Seconds 3–6: She extends her left hand; he slides the ring on. Wind pulls at their clothes.

Seconds 6–9: He rises in one weighted motion and takes his balaclava off with both hands, holding it at his side. She pulls the balaclava off in one upward motion, her copper-red bob springing loose into the wind.

Seconds 9–12: They kiss — full embrace, her hand on the back of his neck, his free arm around her waist, balaclava hanging from his hand.

Seconds 12–15: The embrace holds as the camera leaves them — the couple stays exactly where they stood on the roof, small but clearly visible in the final wide, the flag flying from the mast tip above them.

CAMERA — one continuous dynamic crane move, smooth and controlled, never wild. The camera is ALREADY MOVING at frame one — there is no static hold and no ramp-up from stillness:

Seconds 0–3: From the start-frame position the camera is mid-arc, drifting laterally around the couple at a steady pace (partial orbit, roughly a quarter circle — NOT a full orbit around the tower), background parallax sliding continuously, with a subtle roll easing into a light dutch angle and back.

Seconds 3–6: The arc continues, rising slightly; the city parallax slides behind the couple. Another gentle roll accent.

Seconds 6–9: The crane keeps arcing and starts pulling back and up, framing widening as the reveals happen; the mast slides through the foreground once, briefly.

Seconds 9–12: Pullback accelerates smoothly — the camera climbs and recedes, a last soft dutch roll, the platform shrinking, the spire entering the frame full height.

Seconds 12–15: The move settles into a final wide: the antenna spire and the crown in frame, the embracing couple still clearly visible on the platform, the navy flag flying at the mast tip above them. The pullback stops early enough that the couple remains readable. Camera nearly static at the end, just a breath of drift.

AUDIO: wind, fabric flutter, distant city rumble. No music, no voiceover.

CONSTRAINTS: One continuous shot, no cuts, no slow motion. Identities locked to the reference images — no face drift. The look never changes from the start frame's degraded hazy news-footage quality. The flag matches the prop sheet exactly whenever visible; no other text, no lower thirds, no logos, no timestamp. The couple never leaves the roof and stays visible through the final frame.

Le 5 regole che salvano qualsiasi video AI

  1. Lo start frame porta il look. Descrivi lo stile una volta sola, nell'immagine. Il prompt video deve solo puntare al frame.
  2. Ogni reference ha un solo compito. Identità ≠ composizione ≠ stile ≠ oggetti. Dichiaralo nel prompt, immagine per immagine.
  3. "Brutto" è una skill. Artefatti di compressione, luci bruciate e motion blur vendono il realismo più di qualsiasi grading cinematografico.
  4. Un'ancora fissa per ogni movimento di camera impossibile. Nel mio video: l'antenna come asse di rotazione. Ferma il drift della camera.
  5. Nascondi le transizioni. Reveal, cambi e trasformazioni vanno piazzati dove qualcosa copre naturalmente il soggetto.

Quanto costa e quanto tempo serve

Sfatiamo il mito: non è gratis e non si fa in cinque minuti. I modelli top richiedono piani a pagamento (siamo nell'ordine di decine di euro al mese, non migliaia) e il mio video ha richiesto qualche ora tra character sheet, tentativi sul look e generazioni. Ma il paragone va fatto con l'alternativa: una produzione video reale di questo tipo sarebbe semplicemente impossibile — o costerebbe decine di migliaia di euro.

È esattamente il tipo di contenuto che uso anche per i clienti: video per ads ed eventi che con una produzione tradizionale non avrebbero budget.

FAQ

Video come questo li creo anche per aziende ed eventi — se vuoi contenuti AI per il tuo brand, le tue ads o il tuo locale, dai un'occhiata ai servizi.

Vuoi un video così per il tuo brand?

Prima call gratuita di 30 minuti. Ti dico se e come l'AI può funzionare per i tuoi contenuti.