solved classic rl environments
💼 Hiring
Nitish Pandey
nitishpandey04
AI & ML interests
LLMs, Translation
Recent Activity
liked a model 3 days ago
Qwen/Qwen3.8-Flash-Next liked a model 3 days ago
zai-org/GLM-5.3-Flash commentedon a paper 27 days ago
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement