AIRLLM : faites tourner un modèle de 70 milliards de paramètres sur une carte graphique de 4 Go
📌 AIRLLM est une bibliothèque d’inférence qui charge les LLM couche par couche, permettant de lancer un 70B — voire un DeepSeek-V3 671B — sur 4 à 12 Go de VRAM, sans quantification.
