Step-Video-T2V

StepFun
class B live

30B open-weights text-to-video model (~8s) with a deep-compression VAE; MIT-licensed, self-host plus free online demo.

Layer 1 — factual axes

API & price self-host only official source ↗ 2026-07-04
Max output 204 frames (~8s) · 544×992 official source ↗ 2026-07-04
Native audio no official source ↗ 2026-07-04
Weights open · MIT official source ↗ 2026-07-04
Free tier open self-host (free demo at yuewen.cn) official source ↗ 2026-07-04

Layer 2 — output quality

No independent measure yet. We publish a quality figure only when a named external benchmark ranks this model — we don’t invent one.

Eligible for Best freeOpen-weights

30B open-weights text-to-video model (~8s) with a deep-compression VAE; MIT-licensed, self-host plus free online demo.

Data as of 2026-07-04 · verified 2026-07-04. One ruler for all tools. How we measure ↗