Checkpoints (bf16, 50-step) + train/eval data for RLTR (transfer-reward RL) incl. cross-family (gemma) receiver.
HyunseokLee
hyunseoki
AI & ML interests
None yet
Recent Activity
updated a collection about 14 hours ago
Meta-Harness v1b: Policy x Harness Co-Evolution updated a model about 14 hours ago
hyunseoki/mh-v1b-imo-9b-reclaim-bestonly published a model about 15 hours ago
hyunseoki/mh-v1b-imo-9b-reclaim-bestonlyOrganizations
RLTR: Learning Robust Reasoning via Transfer
Checkpoints (bf16, 50-step) + train/eval data for RLTR (transfer-reward RL) incl. cross-family (gemma) receiver.
Meta-Harness v1b: Policy x Harness Co-Evolution
Co-evolution GRPO (verl, Qwen3.5): shared policy = grader/solver + harness-editor. IMO/paper-review/math. bf16 checkpoints + evolved scaffolds.
models 79
hyunseoki/mh-v1b-imo-9b-reclaim-bestonly
Text Generation • 9B • Updated
hyunseoki/rltr-qwen3-8b-to-gemma4b-polaris
Updated
hyunseoki/mh-v1b-imo-9b-t20
Text Generation • 9B • Updated • 2
hyunseoki/rltr-qwen3-4b-polaris-baseline
Updated
hyunseoki/rltr-qwen3-4b-to-1p7b-polaris
Updated
hyunseoki/rltr-qwen3-8b-to-4b-polaris
Updated
hyunseoki/rltr-qwen3-8b-to-4b-deepmath
Updated
hyunseoki/rltr-qwen3-8b-polaris-baseline
Updated
hyunseoki/mh-v1b-math-4b-sym-sp2
Text Generation • 4B • Updated
hyunseoki/mh-v1b-imo-9b-taonly-baseline
Text Generation • 9B • Updated • 1
datasets 18
hyunseoki/rltr-data
Updated • 9
hyunseoki/mh-v1b-scaffolds
Updated • 10
hyunseoki/regUIDE-rebuttal-artifacts
Updated • 139
hyunseoki/memory-reasoning-split-eval-sets
Preview • Updated • 108
hyunseoki/popqa-mini-ner-knowledge-masks
Preview • Updated • 10
hyunseoki/qwen3-0p6b-openthoughts-self-distill-10k
Preview • Updated • 6
hyunseoki/qwen3-0p6b-openthoughts-self-distill-1k
Preview • Updated • 10
hyunseoki/openthoughts3-dedup-index
Updated • 8
hyunseoki/numina-math-10k-seed13
Viewer • Updated • 11k • 11
hyunseoki/prefixgen_MATH
Viewer • Updated • 60k • 34