# Guía para Subir tus archivos .mat de SHHS ## Dónde subir los archivos ### Opción 1: Hugging Face Dataset (RECOMENDADO) 1. Crea un **Dataset privado** en HuggingFace: - Ve a https://huggingface.co/new-dataset - Nombre sugerido: `Gastpm/shhs-mat-files` - Marca como **Private** (datos médicos sensibles) - Selecciona formato "Files" 2. Sube los archivos .mat: ```bash pip install huggingface_hub huggingface-cli login huggingface-cli upload Gastpm/shhs-mat-files /ruta/local/a/tus/archivos/mat/*.mat . ``` 3. En el job de entrenamiento, los descargamos: ```python from huggingface_hub import snapshot_download snapshot_download(repo_id="Gastpm/shhs-mat-files", local_dir="/app/data") ``` ### Opción 2: Hugging Face Bucket - Ve a https://huggingface.co/new-bucket - Nombre: `Gastpm/shhs-data-bucket` - Sube archivos vía web o API ## Cuántos archivos necesitas | Escenario | Mínimo recomendado | |-----------|-------------------| | **Smoke test** | 5-10 archivos | | **Entrenamiento mínimo** | 100-200 archivos (~20% del dataset) | | **Entrenamiento completo** | 1000+ archivos | | **Entrenamiento óptimo** | 4000-5000 archivos (todo SHHS) | ### Reglas prácticas: 1. **Mínimo para empezar**: 50 archivos con 3-4 horas cada uno - Genera ~10,000-15,000 ventanas de 15 min - Suficiente para aprender patrones básicos 2. **Mínimo viable**: 200 archivos - ~50,000-80,000 ventanas - Split 70/15/15 da conjuntos razonables - Sensibilidad >60% posible si hay suficientes eventos 3. **Recomendado**: 1000+ archivos - Mejor robustez entre pacientes - Maneja desbalance real (~5-10% positivos) 4. **Tus 4500-5000 archivos**: Ideal - Dataset completo SHHS - Máxima diversidad de pacientes y severidades ## Estructura de archivos esperada Cada `.mat` debe contener: ``` HR (N,) - Frecuencia cardíaca 1Hz SaO2 (N,) - SpO2 1Hz, resolución 1% Target03 (N,) - 0=normal, !=0=apnea/hipopnea OXStat (N,) - 0=buena calidad, !=0=artefacto ``` ## Tamaño estimado - 8 horas @ 1Hz ≈ 400-500 KB por archivo - 5000 archivos ≈ 2-2.5 GB total - HuggingFace soporta archivos grandes sin problema ## Límites gratuitos - **Datasets**: Sin límite estricto, archivos >5GB usan LFS - **Buckets**: Almacenamiento generoso para ML - **Jobs GPU**: Hasta 24GB VRAM (A10G) ## Próximo paso 1. Crea dataset/bucket en HuggingFace 2. Sube archivos .mat (en lotes de 100-500) 3. Ejecutamos job de entrenamiento en GPU