Hugging Face
Models
Datasets
Spaces
Buckets
new
Docs
Enterprise
Pricing
Website
Tasks
HuggingChat
Collections
Languages
Organizations
Community
Blog
Posts
Daily Papers
Hardware
Learn
Discord
Forum
GitHub
Solutions
Team & Enterprise
Hugging Face PRO
Enterprise Support
Inference Providers
Inference Endpoints
Storage Buckets
Log In
Sign Up
Alvin
AZH04
8
1
Follow
21world's profile picture
1 follower
·
6 following
AI & ML interests
None yet
Recent Activity
authored
a paper
about 13 hours ago
Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher
authored
a paper
about 13 hours ago
AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents
authored
a paper
about 13 hours ago
Continual Learning Mechanisms Compose for Long-Horizon Memorization
View all activity
Organizations
AZH04
's models
24
Sort: Recently updated
AZH04/maxrl-gsm8k-skipjack-b32
Updated
21 days ago
AZH04/SmolLM2-360M-base-gsm8k-boxed-sft-ep49
0.4B
•
Updated
23 days ago
•
29
AZH04/SmolLM2-360M-base-gsm8k-boxed-sft-ep32
0.4B
•
Updated
23 days ago
•
31
AZH04/SmolLM2-360M-base-gsm8k-boxed-sft-ep24
0.4B
•
Updated
23 days ago
•
29
AZH04/SmolLM2-360M-base-gsm8k-boxed-sft-ep16
0.4B
•
Updated
23 days ago
•
24
AZH04/maxrl-gsm8k-skipjack-2
Updated
23 days ago
AZH04/SmolLM2-360M-base-gsm8k-boxed-sft-ep12
0.4B
•
Updated
23 days ago
•
26
AZH04/SmolLM2-360M-base-gsm8k-boxed-sft
0.4B
•
Updated
23 days ago
•
40
AZH04/SmolLM2-360M-base-gsm8k-boxed-sft-ep9
0.4B
•
Updated
23 days ago
•
19
AZH04/maxrl-gsm8k-skipjack-ckpts-b32
Updated
23 days ago
AZH04/maxrl-gsm8k-skipjack-ckpts
Updated
24 days ago
AZH04/maxrl-gsm8k-skipjack
Updated
24 days ago
AZH04/SmolLM2-360M-instruct-gsm8k-boxed-sft
0.4B
•
Updated
27 days ago
•
18
AZH04/qwen35-4b-v6-2-sft-merged
Updated
Aug 19
AZH04/qwen35-4b-proposer-sft-v8-merged
Updated
Aug 19
AZH04/cache-v7gen3
Updated
Aug 18
AZH04/cache-zk7m
Updated
Aug 16
AZH04/v8
Updated
Jul 21
AZH04/v7
Updated
Jul 21
AZH04/v6
Updated
Jul 21
AZH04/v5
Updated
Jul 21
AZH04/Taxi-v3
Reinforcement Learning
•
Updated
Feb 17, 2025
AZH04/q-FrozenLake-v1-4x4-noSlippery
Reinforcement Learning
•
Updated
Feb 17, 2025
AZH04/ppo-LunarLander-v2
Reinforcement Learning
•
Updated
Dec 27, 2024
•
1