Using RL to elicit context leverage ability of LLMs to learn unseen languages!
Hanxu Hu PRO
HanxuHU
AI & ML interests
LLM, NLP
Organizations
models 14
HanxuHU/Qwen2-0.5B-SFT
Updated
HanxuHU/self-seq-Meta-Llama-3-8B-tulu100k_seq_it2_llama70b
Updated • 16 • 1
HanxuHU/self-seq-Meta-Llama-3-8B-tulu100k_base_ours_new_llama70b
Text Generation • Updated • 9 • 1
HanxuHU/sit_all_models
Updated
HanxuHU/flancot_full_it1
Updated
HanxuHU/sharegpt_filter
Updated
HanxuHU/files
Updated
HanxuHU/my-mLLMs
Updated
HanxuHU/multilingual_mmmu
Updated
HanxuHU/alpaca_topk_indices
Updated
datasets 66
HanxuHU/rl-new-language
Viewer • Updated • 135k • 646
HanxuHU/ocr_data_question_28k_Qwen3-8B
Viewer • Updated • 28k • 27
HanxuHU/usaco_v2
Viewer • Updated • 294 • 10
HanxuHU/math_copy1
Viewer • Updated • 12.5k • 10
HanxuHU/math
Viewer • Updated • 12.5k • 486
HanxuHU/mt_data
Viewer • Updated • 796k • 296
HanxuHU/gemma-llama-2-9b-it-ultrafeedback-annotate-ultrafb-judge-5-maj
Viewer • Updated • 60k • 9
HanxuHU/gemma2-9B-it-ultrafeedback-annotate-ultrafb-merge-single-filtered
Viewer • Updated • 56.4k • 8
HanxuHU/gemma2-9B-it-ultrafeedback-annotate-ultrafb-judge-5-majority-filtered
Viewer • Updated • 55.2k • 4
HanxuHU/gemma2-9B-it-ultrafeedback-annotate-ultrafb-merge-single-judge
Viewer • Updated • 60.7k • 7