ReToken: One Token to Improve Vision-Language Models for Visual Retrieval Paper • 2607.28627 • Published 7 days ago • 8
RefCaptioner: Multi-Reference Image-Grounded Video Captioning Paper • 2607.28509 • Published 7 days ago • 30
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction Paper • 2607.29677 • Published 6 days ago • 18
view article Article Accelerating Transformers Fine-Tuning with NVIDIA NeMo AutoModel nvidia • Jun 24 • 39
view article Article One Adapter, Both Modalities: Field Notes from Building and Serving a Multimodal Reranker lightonai • 20 days ago • 19
view article Article NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval nvidia • 20 days ago • 58
view article Article Fine-tune video and image models at scale with NVIDIA NeMo Automodel and 🤗 Diffusers nvidia • 19 days ago • 82
view article Article LFM2.5-Encoders for Fast Long-Context Inference on CPU LiquidAI • 8 days ago • 65
view article Article mDenseOn with the mLateOn: Open Multilingual, Long-Context, and Code Retrieval Models lightonai • 6 days ago • 32
F2LLM-v2: Inclusive, Performant, and Efficient Embeddings for a Multilingual World Paper • 2603.19223 • Published Mar 19 • 39
Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification Paper • 2607.24027 • Published 10 days ago • 36
Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation Paper • 2607.24731 • Published 10 days ago • 76
JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents Paper • 2607.23588 • Published 11 days ago • 124
ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition Paper • 2607.25565 • Published 9 days ago • 65
CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents Paper • 2607.25431 • Published 9 days ago • 111