Las IAs de GENERACIÓN DE VÍDEO tenían un PROBLEMA...
Dot CSV
Apr 2, 2025
Los modelos de generación de vídeo actuales fracasan al simular físicas porque procesan píxeles y movimiento como una sola tarea compleja. Meta propone desacoplar el aprendizaje de la apariencia y el movimiento, permitiendo que la IA comprenda la coherencia temporal y las leyes físicas de manera independiente, superando así los errores de propagación de modelos como Sora.
Key insight: Meta demostró que las IAs tradicionales no distinguen entre un vídeo lógico y uno con fotogramas desordenados; al separar apariencia y movimiento, el modelo Video Joint Embedding Predictive Architecture (V-JEPA) finalmente logra entender la causalidad temporal.