import pandas as pd from pathlib import Path import re def find_unnamed_columns(data_dir: str): path = Path(data_dir) found_issues = False print(f"🔍 Scanning {data_dir} for 'Unnamed' columns...\n") # 遍历所有 Excel 文件 for file_path in path.rglob("*.xls*"): # 跳过临时文件 if file_path.name.startswith("~$"): continue try: xls = pd.read_excel(file_path, sheet_name=None) for sheet_name, df in xls.items(): # 检查是否有 Unnamed 列 unnamed_cols = [c for c in df.columns if "Unnamed" in str(c)] if unnamed_cols: found_issues = True print(f"⚠️ File: {file_path} | Sheet: {sheet_name}") print(f" Found columns: {unnamed_cols}") # 打印前 3 行内容,帮助判断是不是垃圾数据 print(f" Sample content:") print(df[unnamed_cols].head(3).to_string(index=False)) print("-" * 40) except Exception as e: print(f"❌ Error reading {file_path.name}: {e}") if not found_issues: print("✅ No 'Unnamed' columns found!") if __name__ == "__main__": find_unnamed_columns("data")