OllamaとDocker連携で踏んだ3つの落とし穴
RTX 5060 Tiなどの16GB環境でgemma3:27bを動かすときに、num_threadやstreamの指定漏れでハマる状況を防ぐ。
ローカルLLMの運用において、モデルサイズがVRAM容量を少しでも超えると処理速度が大幅に低下する。また、Docker上のNode.jsからHTTPで呼び出す際に、設定値の省略やネットワーク制限に起因してエラーなく挙動がおかしくなる現象と、その対策が実測値とともに示されている。
元の記事:VRAMに載らないと13.8倍遅い ─ Ollamaを Docker + Node.js から叩いて踏んだ3つの落とし穴(Zenn・chiaki_ai_lab・10月1日)