{ "_target_": "jepa.JEPA", "encoder": { "_target_": "pc_encoders.pointvit_encoder.PointViTEncoder", "embed_dim": 192, "in_channels": 3, "num_tokens": 256, "group_size": 32, "group_radius": 0.04, "group_max_neighbors": 128, "vit_size": "tiny", "vit_pretrained": false, "tokenizer_hidden": [ 128, 256 ], "use_feat": false, "norm_center": [ 0.98, 0.0, 0.17 ], "norm_scale": 0.48 }, "predictor": { "_target_": "module.ARPredictor", "num_frames": 3, "input_dim": 192, "hidden_dim": 192, "output_dim": 192, "depth": 6, "heads": 16, "mlp_dim": 2048, "dim_head": 64, "dropout": 0.1, "emb_dropout": 0.0 }, "action_encoder": { "_target_": "module.Embedder", "input_dim": 10, "emb_dim": 192 }, "projector": { "_target_": "module.MLP", "input_dim": 192, "output_dim": 192, "hidden_dim": 2048, "norm_fn": { "_target_": "torch.nn.BatchNorm1d", "_partial_": true } }, "pred_proj": { "_target_": "module.MLP", "input_dim": 192, "output_dim": 192, "hidden_dim": 2048, "norm_fn": { "_target_": "torch.nn.BatchNorm1d", "_partial_": true } } }