Hugging Face
Models
Datasets
Spaces
Buckets
new
Docs
Enterprise
Pricing
Website
Tasks
HuggingChat
Collections
Languages
Organizations
Community
Blog
Posts
Daily Papers
Hardware
Learn
Discord
Forum
GitHub
Solutions
Team & Enterprise
Hugging Face PRO
Enterprise Support
Inference Providers
Inference Endpoints
Storage Buckets
Log In
Sign Up
🏗️
Building on HF
9.2
TFLOPS
Sergio Paniego
PRO
sergiopaniego
234
203
129
Follow
Whizzkk's profile picture
schoolkithub's profile picture
aman2191's profile picture
1,906 followers
·
133 following
https://sergiopaniego.github.io/
sergiopaniego
sergiopaniego
sergio-paniego-blanco
AI & ML interests
None yet
Recent Activity
updated
a dataset
8 minutes ago
huggingface-projects/Deep-RL-Course-Certification
updated
a dataset
39 minutes ago
agents-course/certificates
updated
a dataset
about 13 hours ago
agents-course/final-certificates
View all activity
Organizations
sergiopaniego
's models
152
Sort: Recently updated
sergiopaniego/rl-envs-youtube-livestream-4-scripts
Updated
18 days ago
sergiopaniego/qwen3-1.7b-mbpp-grpo
Text Generation
•
2B
•
Updated
18 days ago
•
527
sergiopaniego/qwen3-1.7b-wordle-grpo
Text Generation
•
2B
•
Updated
18 days ago
•
459
sergiopaniego/Qwen3-4B-claude-code-local-grpo
Text Generation
•
4B
•
Updated
Jul 31
•
8
sergiopaniego/Qwen3-4B-claude-code-deepcoder-grpo
Text Generation
•
4B
•
Updated
Jul 31
•
10
sergiopaniego/pelican-svg-grpo-Qwen3-1.7B-judged
Text Generation
•
2B
•
Updated
Jul 29
•
10
sergiopaniego/pelican-svg-grpo-Qwen3-1.7B
Text Generation
•
2B
•
Updated
Jul 29
•
9
sergiopaniego/Qwen3-8B-opencode-deepcoder-grpo
Text Generation
•
8B
•
Updated
Jul 28
•
53
•
1
sergiopaniego/grpo-youtube-livestream-3-scripts
Reinforcement Learning
•
Updated
Jul 27
•
2
sergiopaniego/qwen3-0.6b-mbpp-grpo-k2
Text Generation
•
0.6B
•
Updated
Jul 27
•
8
sergiopaniego/qwen3-0.6b-mbpp-grpo-k16
Text Generation
•
0.6B
•
Updated
Jul 27
•
15
sergiopaniego/qwen3-0.6b-mbpp-grpo-k8
Text Generation
•
0.6B
•
Updated
Jul 27
•
15
sergiopaniego/Qwen3.5-4B-sdpo-math-hints
Updated
Jul 10
•
1
sergiopaniego/Qwen3.5-4B-sdpo-math-gold
Updated
Jul 10
sergiopaniego/Qwen3.5-4B-sdpo-math-baseline
Updated
Jul 10
sergiopaniego/sdpo-hints
Updated
Jul 10
sergiopaniego/pi-mono-youtube-livestream-2-scripts
Updated
Jul 6
•
2
sergiopaniego/gemma-4-E2B-offpolicy-kd-lr1e4
Updated
Jul 6
sergiopaniego/gemma-4-E2B-offpolicy-kd-lr2e4
Updated
Jul 6
sergiopaniego/gemma-4-E2B-offpolicy-kd-lr5e5
Updated
Jul 6
sergiopaniego/qwen3-0.6b-pimono-gkd-lr2e5
Text Generation
•
0.6B
•
Updated
Jul 2
•
14
sergiopaniego/qwen3-0.6b-pimono-gkd-lr1e5
Text Generation
•
0.6B
•
Updated
Jul 2
•
10
sergiopaniego/qwen3-0.6b-pimono-gkd-lr5e5
Text Generation
•
0.6B
•
Updated
Jul 2
•
13
sergiopaniego/qwen3-0.6b-pimono-logit-kd-lr1e5
Text Generation
•
0.6B
•
Updated
Jul 2
•
8
sergiopaniego/qwen3-0.6b-pimono-logit-kd-lr2e5
Text Generation
•
0.6B
•
Updated
Jul 2
•
9
sergiopaniego/qwen3-0.6b-pimono-logit-kd-lr5e5
Text Generation
•
0.6B
•
Updated
Jul 2
•
10
sergiopaniego/Qwen2.5-0.5B-Instruct-text-to-sql-qlora
Updated
Jun 15
sergiopaniego/browsergym-grpo-functiongemma-270m-it
Text Generation
•
0.3B
•
Updated
May 29
•
8
•
2
sergiopaniego/qwen3-grpo-requests
Updated
May 19
sergiopaniego/reasoning-gym-chain-sum-Qwen3-1.7B-sft
Text Generation
•
2B
•
Updated
May 4
•
8
Previous
1
2
3
...
6
Next