Orca: The World is in Your Mind
Orca establishes a unified world latent space through next-state-prediction modeling using multimodal data and demonstrates superior performance in downstream tasks compared to spe…
Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.
Orca establishes a unified world latent space through next-state-prediction modeling using multimodal data and demonstrates superior performance in downstream tasks compared to spe…
DOPD addresses privilege illusion in on-policy distillation by dynamically routing token-level supervision between teacher and student policies based on advantage gaps and probabil…
Tool-Augmented Credit Optimization (TACO) improves multimodal agent performance by distinguishing useful, redundant, or misleading code operations through dual advantage channels:…
ILLUME-X is a unified multimodal paradigm that enhances text-image generation through improved data efficiency, stable training processes, and comprehensive evaluation metrics.
A novel pipeline called MatMMExtract is introduced that processes compound scientific figures into individual panels and generates structured annotations using large language model…
CogSENet presents a novel blind image deblurring framework inspired by eagle vision, incorporating semantic-aware modules and frequency decomposition for improved restoration quali…
Em vez de esperar uma pergunta para então analisar um vídeo inteiro, o VLX-Flow mantém um entendimento da cena que se atualiza quadro a quadro — com latência estável mesmo quando o histórico cresce.
A new benchmark evaluates multimodal large language models' ability to understand video content and perform GUI tasks, while a novel keyframe extraction method improves performance…
Vision-language dataset distillation method using rank-aware hyperbolic alignment to optimize synthetic image-text pairs for efficient contrastive model training while preserving m…
A Alibaba abriu um "modelo de mundo de linguagem" que imita sete ambientes — do terminal ao Android — para que agentes de IA pratiquem antes de agir de verdade. A versão maior já supera modelos proprietários de fronteira.
Modelo de visão e linguagem — 51.3 mil downloads e 71 curtidas no Hugging Face.
Modelo de geração de texto · 35 B de parâmetros — 51.8 mil downloads e 58 curtidas no Hugging Face.