Modelo
Dados & Embeddings
inference-optimization/Kimi-K3-0.40B
Modelo de embeddings · 400 M de parâmetros — 22.2 mil downloads e 70 curtidas no Hugging Face.
Hugging Face · Modelos
·inference-optimization
·
·↓ 22152
·♥ 70
O modelo inference-optimization/Kimi-K3-0.40B aparece entre os mais comentados do Hugging Face — um termômetro do que a comunidade está realmente usando agora na tarefa de embeddings.
Ficha técnica
- Tarefa: embeddings
- Parâmetros: 400 M
- Biblioteca:
transformers - Formatos: safetensors
- Licença: MIT
- Downloads: 22.2 mil · Curtidas: 70
Hardware recomendado
Estimativa de VRAM só para carregar os pesos (com ~20% de folga para ativações). Contextos longos consomem memória adicional para o cache de atenção (KV cache).
- Precisão original (16-bit): ~1.0 GB de VRAM — roda em CPU ou GPU de notebook
- Quantizado 8-bit: ~0.5 GB de VRAM — roda em CPU ou GPU de notebook
- Quantizado 4-bit: ~0.2 GB de VRAM — roda em CPU ou GPU de notebook
Como rodar localmente
Gere embeddings com a sentence-transformers:
pip install -U sentence-transformers
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("inference-optimization/Kimi-K3-0.40B")
emb = model.encode(["primeira frase", "segunda frase"])
print(emb.shape)Tags
transformers safetensors kimi_k3 feature-extraction custom_code
// relacionados
Leia também
Blog
Unicorn, pelican, Middle-earth: OpenAI co-founder Karpathy is looking for the next AI vibe test
Editorial
CAPA: o benchmark que mede se o assistente de código aprende com você — ou repete a mesma pergunta
Blog
Why biological data matters more in AI drug discovery
Blog