Agentic Reinforcement Learning
Advanced reinforcement learning methodology developed by liquid-ai as the final stage of their three-phase post-training pipeline for liquid-foundation-models. Specifically designed to address the doom-looping-problem in small models with reasoning traces.
Architecture
Core Components
- Policy model (πθ): Current model being optimized
- Reference model (πref): Baseline for comparison and stability
- Group Computation: Batch processing of multiple reasoning paths
- Multiple Environment Types: Diverse training scenarios for robust agent behavior
Environment Types
- Terminal Env: Command-line and system interaction scenarios
- Search Env: Information retrieval and knowledge synthesis tasks
- OpenClaw Env: Integration with openclaw multi-model harness
- RLM Env: Recursive language modeling environments
Training Process
Input Processing
- Prompt (x): Initial task specification
- *Target output (y)**: Desired completion
- Generation sequences (o1, o2, ..., oG): Multiple candidate outputs
Reward Computation
- Reward signals (r1, r2, ..., rG): Environment-specific feedback
- Advantage estimation (A1, A2, ..., AG): Policy gradient computations
- Group-based optimization: Batch processing for efficiency
Anti-Doom Loop Mechanisms
- N-gram repetition penalty: Prevents repetitive generation patterns
- Reasoning trace validation: Ensures logical consistency
- Multi-environment training: Robust behavior across diverse scenarios
Key Innovations
Doom Loop Mitigation
Specifically addresses the tendency of small models to get stuck in repetitive content generation, particularly problematic when combining <3B parameter models with complex reasoning tasks.
Example Scenario
Input: "I have a great question: what is 2+2?"
Desired: "Fantastic question! Let me unpack this for you. We have 2 + 2 = 4. The final answer is 4."
Ground truth: 4
Result: Correct!
Multi-Environment Training
Exposes models to diverse interaction patterns through different environment types, improving generalization and robustness for agentic applications.
Performance Metrics
Doom Loop Reduction
Significant reduction in doom loop occurrences measured as percentage of failed generations in LFM2.5-1.2B-Thinking model evaluation.
Agentic Capabilities
Enhanced performance on:
- Multi-step reasoning tasks
- Tool use and API interactions
- Complex problem decomposition
- Autonomous task execution
Integration with Liquid AI Pipeline
Post-Training Sequence
- Supervised Fine-Tuning: Task-specific adaptation
- Preference Alignment: Human preference optimization via on-policy-data-generation
- Agentic Reinforcement Learning: Final optimization for autonomous behavior
Data Requirements
- on-policy-data-generation outputs for preference alignment
- Environment-specific reward signals
- Multi-modal interaction scenarios
Applications
Edge Deployment
Optimized for small models requiring autonomous behavior in resource-constrained environments while maintaining reliability and avoiding failure modes.
Tool-Using Agents
Specialized training for models that need to interact with external systems, APIs, and tools in production environments.