メインコンテンツへスキップ

#LlamaCpp

関連タグ

338件

人気の記事一覧

【ローカルLLM】Meta Muse-Glimmer 30Bを使ってみた話【Meta最新LLM】

ローカルLLMは、結局どれで始める? llama.cpp / Ollama / LM Studio の関係を整理してみた

USBに収まるAIを作ってみた。── 弱いローカルAIを「ハーネス」で強力にする

自己改善型コーディングモデル「Ornith-1.0」を9Bと35Bでまとめて検証した(9B 5量子化+35B 3量子化)

Claude Codeを無料で動かしたら別物になった。Opus蒸留GGUFで手触りを揃える方法

RTX 5090 vs Radeon 8060S(iGPU)— 1台のミニPCで完結する、NVIDIA vs AMDローカルLLM最終決戦【検証シリーズ最終回】

Google公式QAT vs Unsloth版、どっちのGemma 4 12Bが優秀? — 自分の環境でガチ検証してみた【第1回】

【2026年6月版】ローカルLLMコーディングベンチ総まとめ — 9B〜35B-A3Bを同一40タスクで並べてランキングした

GTX1060 3GB の古いWin機でローカルAI環境を作る話【第3回:VS Code + Cline で全自動コーディング環境完成】

Fable 5 に匹敵? 話題のローカルモデル Kimi K3(1.56TB!)を動かす方法

gguf-fit を作った ─ GGUF を読むだけで llama-server の起動設定を決める

Qwen3.8-27Bを6量子化で回したら、モデルより先に「自分のベンチのバグ」と「temperature設定」を測っていた

連載の鬼門t020をついに割った:Muse-Glimmer-30B + DFlash を76タスク×5回×2量子化で叩いた

tok/s は 10.5倍違ったのに、遅いほうが勝った:Muse-Glimmer-30B+DFlash を RTX5090 / RTX3090 / AI MAX 395 の4環境で回した

Qwable-3.6を使うならどのモデルを選ぶか:全量子化ベンチまとめ[RTX5090]

【2026年7月版】ローカルLLMベンチ総まとめ — 天井のベンチを16問に作り直した月。60問ではMoEが初めてdenseを抜き、選ぶ軸は「誰の量子化か」に移った

Deepseek v4 flash 0731 284Bを2bitまで潰したGGUFが、クラウドの本家と16問すべて同じ判定を出した

unsloth版Ornith-1.0を10量子化で再検証: 35B UD-Q5_K_Mの40/40満点は、同じ日の60問追試で崩れた

Gemma 4 12Bが「低VRAM勢の神モデル」になりそう ── RTX 3060実測ポストから読む実力

「考える」Gemma 4 31Bで再戦したら、シリーズ皆勤の嘘がついに消えて、GoogleとUnslothに初めて品質差が出た【検証・続編 第1回】

Qwen3.8 27Bは考えすぎる。reasoningを切ったら21分の処理が137秒で終わった

Ollamaなしで複数GGUFを自動で入れ替える(コピペで動くローカルLLM切替) - CodeRouter v2.9.2

Qwopus3.6-27B-Coder(標準版)を「速度」と「評価」で分けて測った — 40タスクで速さ、60タスク×5で実力、そして同名モデルとの比較

【RTX 3090 爆速LLMシリーズ Vol.1】Qwen3.6-35B-A3B を 100〜140 t/s で動かす完全ガイド|AMD AI MAX+ 395 ハイブリッド構成

Unsloth同士の3つ巴。QAT vs 非QAT vs DiffusionGemmaを同じ9種目で殴り合わせたら、QATが「品質互角のまま22%速い」という反則みたいな結果になった【検証・続編 第2回】

Gemma 4 QAT 徹底解説 ── 同じ賢さのままメモリ3分の1、ローカルAIの新常識

Resolved 90%止まり:Qwen3.6-27B-Fable-FusionはMTP版Q5がベスト——“創作寄り”マージはコード特化の兄弟版に届かなかった(5構成×60タスク)

MoE化したGemma 4 26B-A4Bに同じ9種目を投げたら、賢くなって、速くなって、俳句で全員沈んだ【検証第4回】

Fable 5 × Composer 2.5 蒸留ローカルモデル「gemma-4-12B-coder」を40タスクで叩いた[RTX5090]

同じモデルの量子化を「作り手違い」で並べたら順位が逆転:単発ベンチでは作成元も量子化も優劣を決められない Parable-Qwen3-4B-Claude-Fable-5(mradermacher vs AnkitAI)

92日ひとりで書いてきた OSS に、初めて外部からコードが届いた — CodeRouter v2.9.4、自分では気づけなかった KV キャッシュ破壊を直してもらった話

Unsloth Desktop からエージェントに繋ぐ

gguf-fit の使い方だけ ─ 2行で llama-server の起動コマンドをもらう

自分が配ったテンプレが、自動最適化を殺していた — `-ngl 99` と WARN 1行の話 CodeRouter v2.13.0

Unsloth Desktop で最初の1回を回す順番 ─ 既定が30ステップなので、触るのは2周目から

Gemma 4 12Bが示すマルチモーダルAIの新設計――エンコーダを捨てた理由と、発表当日に試した記録

llama.cpp の起動オプション、2026年8月最新版まとめ ─ 初心者ほど「書かない」ほうが速く動く

検出は当たっていたのに起動できなかった — CodeRouter v2.7.6 の MTP 対応は「テスト段階」だと思って使ってほしい話

【RTX 5090 32GB ベンチマーク】RTX 3090との比較|Qwen3.6-35B-A3B + ローカルLLM実測

【ローカルLLM】Macaron-V1-Tallを使ってみた話【Qwen3.6 35B A3B】

【ローカルLLM】ミニゲームを生成して最近の30B前後のLLM性能を比較する話【Gemma/Qwen】

Qwen3.6-27BにDFlashを入れたらコード生成が146 tok/sになった話

llama-swap を見て「launcher で同じことができるのでは」と言ったら、前提が 1 つ古かった — CodeRouter v2.9.1、モデル自動スワップを外部依存ゼロで自前実装した話

118BのLLMモデル Laguna-S-2.1をおうちで動かしてみよう!

EVO-X2にeGPUを2台させたら、また地獄があった話 — RTX 5090 + RTX 3090 デュアルeGPU構築記

同じGPUで結論が4回ひっくり返った — ベンチマークに残すべきは、数字より条件だった Cuda/Vulkan/ROCmで検証

【2026年6月版 v2】ローカルLLMコーディングベンチ総まとめ — 40タスクは飽和した。本当の勝負は60タスク(architect帯)に移り、王者は「無検閲の創作モデル」だった

GTX1060 3GB の古いWin機でローカルAI環境を作る話【第2回:Unsloth Studio との格闘とllama-server直結への辿り着き】

BF16が最下位だった — Qwen3.8-9B を5量子化×60タスク×5回で叩いた