thinkingmachines/Inkling-NVFP4
Modelo de visão e linguagem · MoE — 66.5 mil downloads e 70 curtidas no Hugging Face.
Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.
Modelo de visão e linguagem · MoE — 66.5 mil downloads e 70 curtidas no Hugging Face.
Modelo de visão e linguagem · MoE — 6.8 mil downloads e 107 curtidas no Hugging Face.
We present Wan-Streamer v0.3, which reframes our native-streaming interaction model under a single organizing view: a video is a world plus an event stream. The world is the persis…
Visually impaired individuals (VIIs) encounter significant daily challenges due to limited access to visual information.
Modelo de visão e linguagem · MoE — 65.0 mil downloads e 1.7 mil curtidas no Hugging Face.
Dataset em destaque no Hugging Face — 2.4 mil downloads. OCR UV Scripts Part of uv-scripts — self-contained UV scripts you run on Hugging Face Jobs in one command.
Modelo de video text to text — 544 downloads e 85 curtidas no Hugging Face.
arXiv:2607.12293v1 Tipo de anúncio: novo Resumo: Prever a intenção de travessia de pedestres é uma tarefa crítica para a segurança na condução autônoma, mas as abordagens existentes muitas vezes dependem de entradas de modalidade única ou de estratégias de fusão multimodal densa que capturam de forma inadequada informações visuais e cinemáticas complementares, ao mesmo tempo em que introduzem interações intermodais redundantes. Nós propomos o ADAPT (Adaptive Domain-Aware Pedestrian Crossing Transformer), um framework multimodal que modela conjuntamente o visu... local e global
arXiv:2607.12304v1 Tipo de Anúncio: novo Resumo: Uma pontuação em um benchmark de perguntas e respostas temporais sobre vídeo tem o objetivo de medir se um modelo possui compreensão temporal, mas ela mistura duas questões. 1. A questão da tarefa: a pergunta é de fato temporal, ela precisa de vários frames e da ordem deles? e 2. A questão do canal: quando ela precisa, o modelo recupera a ordem a partir dos pixels ou a lê a partir da codificação posicional (RoPE)? A maior parte de uma pontuação temporal não responde a nenhuma das duas, um único frame e uma resp...
arXiv:2607.11957v1 Tipo de Anúncio: novo Resumo: A manutenção de infraestruturas críticas, como ferrovias e usinas de energia, é essencial para garantir a segurança e a confiabilidade operacional. No entanto, o número decrescente de trabalhadores de manutenção qualificados evidencia a necessidade de transferir o conhecimento dos especialistas para trabalhadores menos experientes. Estudos anteriores tentaram extrair candidatos ao conhecimento especializado comparando vídeos de trabalho baseado em manuais com vídeos de trabalhadores especialistas, focando principalmente nas diferenças ...
arXiv:2607.11939v1 Tipo de anúncio: novo Resumo: A previsão precisa de trajetórias de pedestres em ambientes lotados continua sendo um desafio devido à incerteza multimodal do movimento humano e à complexidade variável da dinâmica de movimento em diferentes contextos de cena. Os modelos condicionados por objetivo existentes dependem de estruturas de deslocamento estáticas que atribuem peso igual a todos os passos de tempo históricos, mecanismos padrão de atenção em grafos e decodificadores de movimento de capacidade fixa que não conseguem se adaptar à previsão local...
arXiv:2607.12048v1 Tipo de anúncio: novo Resumo: A implantação de sistemas de respostas a perguntas visuais médicas (MedVQA) em ambientes clínicos do mundo real exige modelos que se adaptem a novas tarefas clínicas sem esquecer o conhecimento adquirido anteriormente. O aprendizado contínuo (CL) oferece um arcabouço prático para esse cenário. Apesar do rápido progresso nos modelos médicos de visão e linguagem, o comportamento dos métodos de CL ao treinar esses modelos em tarefas heterogêneas de MedVQA permanece pouco explorado. Este trabalho apresenta...