Explorer
- .. (Parent Directory)
- 2503.09573.pdf
- 2506.14202.pdf
- 2605.01205 - SRA - Span Representation Alignment for Large Language Model Distillation.pdf
- 2605.01374 - MTA - Multi-Granular Trajectory Alignment for Large Language Model Distillation.pdf
- 2605.03301 - SHIELD - A Diverse Clinical Note Dataset and Distilled Small Language Models for Enterprise-Scale De-identification.pdf
- 2605.03677 - Uni-OPD - Unifying On-Policy Distillation with a Dual-Perspective Recipe.pdf
- 2605.07482 - SHRED - Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion.pdf
- 2605.07711 - SimCT - Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation.pdf
- 2605.07804 - Prune-OPD - Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning.pdf
- 2605.08738 - SlimQwen - Exploring the Pruning and Distillation in Large MoE Model Pre-training.pdf
- 2605.09253 - Cornerstones or Stumbling Blocks Deciphering the Rock Tokens in On-Policy Distillation.pdf
- 2605.11458 - Adaptive Teacher Exposure for Self-Distillation in LLM Reasoning.pdf
- 2605.13230 - Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence.pdf
- 2605.15913 - Towards Generalization of Block Attention via Automatic Segmentation and Block Distillation.pdf
- 2605.16826 - Decoupling KL and Trajectories - A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation.pdf
- 2605.17497 - Self-Supervised On-Policy Distillation for Reasoning Language Models.pdf
- 2605.17710 - Sometin Beta Pass Notin (SBPN) - Improving Multilingual ASR for Nigerian Languages via Knowledge Distillation.pdf
- 2605.17831 - Agentic Cost-Aware Query Planning with Knowledge Distillation for Big Data Analytics.pdf
- 2605.17839 - Balancing Knowledge Distillation for Imbalance Learning with Bilevel Optimization.pdf
- 2605.17873 - HINT-SD - Targeted Hindsight Self-Distillation for Long-Horizon Agents.pdf
- 2605.18028 - FedSDR - Federated Self-Distillation with Rectification.pdf
- 2605.18299 - SD-Search - On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning.pdf
- 2605.18529 - AMR-SD - Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment.pdf
- 2605.18643 - Post-Trained MoE Can Skip Half Experts via Self-Distillation.pdf
- 2605.18654 - Pocket Foundation Models - Distilling TFMs into CPU-Ready Gradient-Boosted Trees.pdf
- 2605.18702 - Distilling Tabular Foundation Models for Structured Health Data.pdf
- 2605.18740 - Vision-OPD - Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation.pdf
- 2605.19299 - Cross-Paradigm Knowledge Distillation - A Comprehensive Study of Bidirectional Transfer Between Random Forests and Deep Neural Networks for Big Data Applications.pdf
- 2605.19433 - Backtracking When It Strays - Mitigating Dual Exposure Biases in LLM Reasoning Distillation.pdf
- 2605.19436 - CEPO - RLVR Self-Distillation using Contrastive Evidence Policy Optimization.pdf
- 2605.19447 - What and When to Distill - Selective Hindsight Distillation for Multi-Turn Agents.pdf
- 2605.19842 - Fast Tensorization of Neural Networks via Slice-wise Feature Distillation.pdf
- 2605.20074 - Towards Distillation Guarantees under Algorithmic Alignment for Combinatorial Optimization.pdf
- 2605.20176 - ClinSeekAgent - Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning.pdf
- 2605.20258 - It Takes Two - Complementary Self-Distillation for Contextual Integrity in LLMs.pdf
- 2605.20643 - AVSD - Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals.pdf
- 2605.21489 - Variance Reduction for Expectations with Diffusion Teachers.pdf
- 2605.21606 - When Are Teacher Tokens Reliable Position-Weighted On-Policy Self-Distillation for Reasoning.pdf
- 2605.21699 - X-Token - Projection-Guided Cross-Tokenizer Knowledge Distillation.pdf
- 2605.22060 - Safeguarding Text-to-Image Generative Models Against Unauthorized Knowledge Distillation.pdf
- 2605.22098 - TextTeacher - What Can Language Teach About Images.pdf
- 2605.22211 - CLORE - Content-Level Optimization for Reasoning Efficiency.pdf
- 2605.22263 - Tailoring Teaching to Aptitude - Direction-Adaptive Self-Distillation for LLM Reasoning.pdf
- 2605.22411 - DeferMem - Query-Time Evidence Distillation via Reinforcement Learning for Long-Term Memory QA.pdf
- 2605.22511 - Search-E1 - Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning.pdf
- 2605.22675 - Self-Policy Distillation via Capability-Selective Subspace Projection.pdf
- 2605.22731 - Post-Training is About States, Not Tokens - A State Distribution View of SFT, RL, and On-Policy Distillation.pdf
- 2605.22737 - The Distillation Game - Adaptive Attacks & Efficient Defenses.pdf
- 2605.23493 - EDGE-OPD - Internalizing Privileged Context with Evidence Guided On-Policy Distillation.pdf
- 2605.23605 - DiLaDiff - Distilled Latent-Augmented Diffusion for Language Modeling.pdf
- 2605.23857 - Strong Teacher Not Needed On Distillation in LLM Pretraining.pdf
- 2605.24530 - Unveil - Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval.pdf
- 2605.25183 - Knowledge Graph-Driven Expert-Level Reasoning for Neuroscience.pdf
- 2605.25210 - Multi-Objective Learning for Diffusion Models - A Statistical Theory under Semi-Supervised Learning.pdf
- 2605.25430 - CODESKILL - Learning Self-Evolving Skills for Coding Agents.pdf
- 2605.25463 - A Lightweight Hybrid Transformer-CRF Architecture for Multi-Type Bangla Medical Entity Recognition.pdf
- 2605.25525 - SAE-FD - Sparse Autoencoder Feature Distillation for Continual Learning of Large Language Models.pdf
- 2605.25582 - Extreme Region Policy Distillation.pdf
- 2605.25676 - Llamion Technical Report.pdf
- 2605.25835 - Context-Instrumental Data Distillation for Kubernetes Manifest Generation - Method and Experimental Evaluation.pdf
- 2605.25969 - Triplet-Block Diffusion RWKV.pdf
- 2605.26106 - Looped Diffusion Language Models.pdf
- 2605.26246 - The Bridge-Garden Dilemma in LLM Distillation - Why Mixing Hard and Soft Labels Works.pdf
- 2605.27255 - Pair-In, Pair-Out - Latent Multi-Token Prediction for Efficient LLMs.pdf
- 2605.27765 - Restoring the Sweet Spot - Pass-Rate Weighted Self-Distillation for LLM Reasoning.pdf
- 2605.27791 - Are Diffusion Language Models Good Database Analysts.pdf
- 2605.28014 - ROSD - Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains.pdf
- 2605.28023 - VCap - Hypergeometric Rewards for Weak-to-Strong Visual Captioning.pdf
- 2605.28181 - When Confidence Misleads - Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models.pdf
- 2605.28303 - From Fact Overwriting to Knowledge Evolution - Causal Editing via On-Policy Self-Distillation.pdf
- 2605.28456 - Diffusion Large Language Models for Visual Speech Recognition.pdf
- 2605.28791 - Skill-Conditioned Gated Self-Distillation for LLM Reasoning.pdf
- 2605.29128 - Apertus LLM Family Expansion via Distillation and Quantization.pdf
- 2605.29380 - TRACER - Persistent Regularization for Robust Multimodal Finetuning.pdf
- 2605.29398 - GDSD - Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models.pdf
- 2605.29992 - Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation.pdf
- 2605.30070 - A Predictive Law for On-Policy Self-Distillation From World Feedback.pdf
- 2605.30111 - xModel-KD - Cross-modal Knowledge Distillation for 3D Scene Perception using LiDAR.pdf
- 2605.30116 - SGMD - Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation.pdf
- 2605.30251 - Same Evidence, Different Answers - Canonical-Context On-Policy Distillation for Multi-Turn Language Models.pdf
- 2605.30288 - MIRA - Mid-training Rubric Anchoring for Source-Aware Data Selection.pdf
- 2605.30772 - FOSTER - First-order Dataset Distillation for Text-based Sequential Recommendation.pdf
- 2605.30861 - Distilling LLM Feedback for Lean Theorem Proving.pdf
- 2605.31073 - ConsisGuard - Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails.pdf
- 2605.31159 - Trust-Region Behavior Blending for On-Policy Distillation.pdf
- 2605.31171 - MIMO - Multilingual Information Retrieval via Monolingual Objectives.pdf
- 2605.31293 - Divergence Decoding - Inference-Time Unlearning via Auxiliary Models.pdf
- 2605.31317 - Forgetting Has Neighbors - Localized Collateral Forgetting in Machine Unlearning.pdf
- 2605.31490 - Are Full Rollouts Necessary for On-Policy Distillation.pdf
- 2606.00305 - Bridging Reasoning Trajectories in On-Policy Distillation via Near-Future Guidance.pdf
- 2606.00995 - Subliminal Learning Is Steering Vector Distillation.pdf
- 2606.01039 - OPD+ - Rethinking the Advantage Design for On-Policy Distillation.pdf
- 2606.01080 - ThinkSwitch - Context Distillation with LoRA and Weight Interpolation for Specific-Purpose Reasoning Tasks.pdf
- 2606.01249 - Trust Region On-Policy Distillation.pdf
- 2606.01292 - What Makes a Strong Model A Unified Spectral Analysis of Knowledge Transfer over High-dimensional Linear Regression.pdf
- 2606.01476 - OmniOPD - Logit-Free On-Policy Distillation via Speculative Verification.pdf