Executar LLMs locais no seu hardware há muito tempo não é mais privilégio de poucos com clusters de H100. Ou ainda é? 😁

🗓 Já hoje às 18:00 (horário de Moscou) acontecerá uma transmissão ao vivo no «Ponto de Montagem». Vamos analisar a instalação e uso de modelos locais.

O que será abordado:
▪️ Como escolher o modelo adequado para o seu hardware, para que ele não consuma toda a memória do sistema e funcione com um TPS (tokens por segundo) adequado.
▪️ Levantar o modelo em modo de chat para tarefas do dia a dia.
▪️ Conectar a LLM local a uma IDE agente (como exemplo, usaremos Kilo Code).
▪️ Roteamento de requisições para o modelo local via LangChain.
▪️ Será que realmente precisamos disso?

A transmissão e a gravação estarão disponíveis para os participantes do «Ponto de Montagem». O acesso é feito através do bot: https://t.me/TScompiler_bot