Nichonauta commited on
Commit
648cedd
·
verified ·
1 Parent(s): 6566a9b

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +32 -31
README.md CHANGED
@@ -11,6 +11,7 @@ tags:
11
  base_model:
12
  - gdhe17/Self-Forcing
13
  ---
 
14
 
15
  # Self-Forcing2.1-T2V-1.3B-GGUF
16
 
@@ -20,66 +21,66 @@ base_model:
20
 
21
  ---
22
 
23
- Desarrollado por <a href="https://www.youtube.com/@nichonauta">Nichonauta</a>.
24
 
25
- Este repositorio contiene las versiones cuantizadas en formato **GGUF** del modelo de generación de video **Self-Forcing**.
26
 
27
- El modelo Self-Forcing es una evolución del `Wan2.1-T2V-1.3B`, optimizado con una innovadora técnica de "auto-forzado" que le permite corregir sus propios errores de generación en tiempo real. Esto resulta en videos más coherentes y de mayor calidad.
28
 
29
- Estos archivos GGUF permiten ejecutar el modelo de manera eficiente en **GPU/CPU**, reduciendo drásticamente el consumo de VRAM y haciendo la generación de video accesible sin necesidad de GPUs de alta gama.
30
 
31
- ## ✨ Características Principales
32
 
33
- - ⚡️ **Inferencia en GPU/CPU:** Gracias al formato GGUF, el modelo puede ejecutarse en una amplia gama de hardware con un rendimiento optimizado.
34
- - 🧠 **Técnica Self-Forcing:** El modelo aprende de sus propias predicciones durante la generación para mejorar la consistencia temporal y la calidad visual del video.
35
- - 🖼️ **Generación guiada por imágenes:** Capacidad para generar transiciones de video fluidas entre una imagen de inicio y una de final, guiado por un prompt de texto.
36
- - 📉 **Bajo Consumo de Memoria:** La cuantización reduce significativamente la huella de memoria RAM/VRAM en comparación con los modelos originales (`FP16`/`FP32`).
37
- - 🧬 **Basado en Arquitectura Sólida:** Hereda la potente base del modelo `Wan2.1-T2V-1.3B`, conocido por su eficiencia y calidad.
38
 
39
- ## Uso
40
 
41
- Los archivos del modelo se pueden usar en [ComfyUI](https://github.com/comfyanonymous/ComfyUI/) con el nodo personalizado [ComfyUI-GGUF](https://github.com/city96/ComfyUI-GGUF).
42
 
43
  ---
44
 
45
- ## 🧐 ¿Qué es GGUF?
46
 
47
- GGUF es un formato de archivo diseñado para almacenar modelos de lenguaje grandes (y otras arquitecturas) para una inferencia rápida en CPU. Las ventajas clave son:
48
 
49
- - **Carga Rápida:** No requiere deserialización compleja.
50
- - **Cuantización:** Permite almacenar los pesos del modelo con precisión reducida (p. ej., 4 u 8 bits en lugar de 16 o 32), lo que reduce el tamaño del archivo y el uso de RAM.
51
- - **Ejecución en GPU/CPU:** Está optimizado para ejecutarse en procesadores de consumo general a través de librerías como `llama.cpp`.
52
 
53
- **Nota:** La ejecución de este modelo de video en formato GGUF requiere un software compatible que pueda interpretar la arquitectura del transformer de difusión de video.
54
 
55
  ---
56
 
57
- ## 📚 Detalles del Modelo y Atribución
58
 
59
- Este trabajo no sería posible sin los proyectos de código abierto que lo preceden.
60
 
61
- ### Modelo Base: Wan2.1
62
 
63
- Este modelo se basa en `Wan2.1-T2V-1.3B`, un potente modelo de texto a video de 1.3 mil millones de parámetros. Utiliza una arquitectura de Transformer de Difusión (DiT) y un VAE 3D (Wan-VAE) optimizado para preservar la información temporal, lo que lo hace ideal para la generación de video.
64
 
65
- - **Repositorio Original:** [Wan-AI/Wan2.1-T2V-1.3B](https://huggingface.co/Wan-AI/Wan2.1-T2V-1.3B)
66
- - **Arquitectura:** Diffusion Transformer (DiT) con un codificador T5 para el texto.
67
 
68
- ### Técnica de Optimización: Self-Forcing
69
 
70
- El modelo `Wan2.1` fue mejorado con el método **Self-Forcing**, que entrena al modelo para reconocer y corregir sus propios errores de difusión en un solo paso hacia adelante. Esto mejora la fidelidad y coherencia sin necesidad de entrenamiento adicional costoso.
71
 
72
- - **Página del Proyecto:** [self-forcing.github.io](https://self-forcing.github.io/)
73
 
74
  -----
75
 
76
- ## 🙏 Agradecimientos
77
 
78
- Agradecemos a los equipos detrás de [Wan2.1](https://huggingface.co/Wan-AI/), [Self-Forcing](https://self-forcing.github.io/), [Stable Diffusion](https://huggingface.co/stabilityai/stable-diffusion-3-medium), [diffusers](https://github.com/huggingface/diffusers) y a toda la comunidad de [Hugging Face](https://huggingface.co) por su contribución al ecosistema de código abierto.
79
 
80
- ## ✍️ Citación
81
 
82
- Si encuentras útil nuestro trabajo, por favor, cita los proyectos originales:
83
 
84
  ```bibtex
85
  @article{wan2.1,
 
11
  base_model:
12
  - gdhe17/Self-Forcing
13
  ---
14
+ ```
15
 
16
  # Self-Forcing2.1-T2V-1.3B-GGUF
17
 
 
21
 
22
  ---
23
 
24
+ Developed by <a href="https://www.youtube.com/@nichonauta">Nichonauta</a>.
25
 
26
+ This repository contains the quantized versions in **GGUF** format of the **Self-Forcing** video generation model.
27
 
28
+ The Self-Forcing model is an evolution of `Wan2.1-T2V-1.3B`, optimized with an innovative "self-forcing" technique that allows it to correct its own generation errors in real-time. This results in more coherent and higher-quality videos.
29
 
30
+ These GGUF files allow the model to be run efficiently on **GPU/CPU**, drastically reducing VRAM consumption and making video generation accessible without the need for high-end GPUs.
31
 
32
+ ## ✨ Key Features
33
 
34
+ - ⚡️ **GPU/CPU Inference:** Thanks to the GGUF format, the model can run on a wide range of hardware with optimized performance.
35
+ - 🧠 **Self-Forcing Technique:** The model learns from its own predictions during generation to improve temporal consistency and visual quality of the video.
36
+ - 🖼️ **Image-guided Generation:** Ability to generate smooth video transitions between a start and an end image, guided by a text prompt.
37
+ - 📉 **Low Memory Consumption:** Quantization significantly reduces the RAM/VRAM memory footprint compared to the original models (`FP16`/`FP32`).
38
+ - 🧬 **Based on a Solid Architecture:** It inherits the powerful base of the `Wan2.1-T2V-1.3B` model, known for its efficiency and quality.
39
 
40
+ ## Usage
41
 
42
+ The model files can be used in [ComfyUI](https://github.com/comfyanonymous/ComfyUI/) with the [ComfyUI-GGUF](https://github.com/city96/ComfyUI-GGUF) custom node.
43
 
44
  ---
45
 
46
+ ## 🧐 What is GGUF?
47
 
48
+ GGUF is a file format designed to store large language models (and other architectures) for fast inference on CPUs. The key advantages are:
49
 
50
+ - **Fast Loading:** Does not require complex deserialization.
51
+ - **Quantization:** Allows model weights to be stored with reduced precision (e.g., 4 or 8 bits instead of 16 or 32), which reduces file size and RAM usage.
52
+ - **GPU/CPU Execution:** It is optimized to run on general-purpose processors through libraries like `llama.cpp`.
53
 
54
+ **Note:** Running this video model in GGUF format requires compatible software that can interpret the video diffusion transformer architecture.
55
 
56
  ---
57
 
58
+ ## 📚 Model Details and Attribution
59
 
60
+ This work would not be possible without the open-source projects that precede it.
61
 
62
+ ### Base Model: Wan2.1
63
 
64
+ This model is based on `Wan2.1-T2V-1.3B`, a powerful 1.3 billion parameter text-to-video model. It uses a Diffusion Transformer (DiT) architecture and a 3D VAE (Wan-VAE) optimized to preserve temporal information, making it ideal for video generation.
65
 
66
+ - **Original Repository:** [Wan-AI/Wan2.1-T2V-1.3B](https://huggingface.co/Wan-AI/Wan2.1-T2V-1.3B)
67
+ - **Architecture:** Diffusion Transformer (DiT) with a T5 text encoder.
68
 
69
+ ### Optimization Technique: Self-Forcing
70
 
71
+ The `Wan2.1` model was enhanced with the **Self-Forcing** method, which trains the model to recognize and correct its own diffusion errors in a single forward pass. This improves fidelity and coherence without the need for costly additional training.
72
 
73
+ - **Project Page:** [self-forcing.github.io](https://self-forcing.github.io/)
74
 
75
  -----
76
 
77
+ ## 🙏 Acknowledgements
78
 
79
+ We thank the teams behind [Wan2.1](https://huggingface.co/Wan-AI/), [Self-Forcing](https://self-forcing.github.io/), [Stable Diffusion](https://huggingface.co/stabilityai/stable-diffusion-3-medium), [diffusers](https://github.com/huggingface/diffusers), and the entire [Hugging Face](https://huggingface.co) community for their contribution to the open-source ecosystem.
80
 
81
+ ## ✍️ Citation
82
 
83
+ If you find our work useful, please cite the original projects:
84
 
85
  ```bibtex
86
  @article{wan2.1,