inference-optimization/Kimi-K3-0.40B

Modelo de embeddings · 400 M de parâmetros — 22.2 mil downloads e 70 curtidas no Hugging Face.

Hugging Face · Modelos ·inference-optimization · ·↓ 22152 ·♥ 70

O modelo inference-optimization/Kimi-K3-0.40B aparece entre os mais comentados do Hugging Face — um termômetro do que a comunidade está realmente usando agora na tarefa de embeddings.

Ficha técnica

  • Tarefa: embeddings
  • Parâmetros: 400 M
  • Biblioteca: transformers
  • Formatos: safetensors
  • Licença: MIT
  • Downloads: 22.2 mil · Curtidas: 70

Hardware recomendado

Estimativa de VRAM só para carregar os pesos (com ~20% de folga para ativações). Contextos longos consomem memória adicional para o cache de atenção (KV cache).

  • Precisão original (16-bit): ~1.0 GB de VRAM — roda em CPU ou GPU de notebook
  • Quantizado 8-bit: ~0.5 GB de VRAM — roda em CPU ou GPU de notebook
  • Quantizado 4-bit: ~0.2 GB de VRAM — roda em CPU ou GPU de notebook

Como rodar localmente

Gere embeddings com a sentence-transformers:

pip install -U sentence-transformers

from sentence_transformers import SentenceTransformer

model = SentenceTransformer("inference-optimization/Kimi-K3-0.40B")
emb = model.encode(["primeira frase", "segunda frase"])
print(emb.shape)

Tags

transformers safetensors kimi_k3 feature-extraction custom_code

Abrir o modelo no Hugging Face →

compartilhar: