大規模言語モデルのベンチマーク、CPU/GPU推論検証、最適化リサーチ。
Qwen3.5でDjango旅行予約サイトを生成
Qwen3.5-122B-A10BとMCPによるローカルWebアプリ開発の検証です。旅行予約、管理画面、6アプリへの拡張を扱い、業務システム開発での生成範囲と必要だった手修正を記録しました。
Jev-Omniのマルチモーダル判定とClefとの比較
音声、画像、日本語メール、動画の35件でJev-Omniを評価し、同じ25件でClefと比較しました。AIシステム開発に向けた選択肢判定の検証です。追加の動画実験と各入力への回答も掲載しています。
DeepSeek Harnessのローカル実行構成
DeepSeek-V4-Flash-Vision-ExpとV4.1-FlashをRTX PRO 6000 Max-Q 2枚で使いました。LLM導入に向け …
DeepSeek V4 Flash 0731のvLLM実測とCPU KV offload
RTX PRO 6000 96GB 2枚でDeepSeek V4 Flash 0731を実測。DSpark K5の速度、CPU KV offload、業務システム開発の生成例を記録します。
GLM-5.2 GGUFの量子化・MTP・expert配置を比較
GLM-5.2 GGUFの1.630bpwと2.244bpwを192GB VRAMで比較。LLM導入の速度・品質・省VRAM構成とMTPの実測を記録します。
DeepSeek-V4-FlashをDwarfStar4の2ノードで評価
DeepSeek-V4-FlashのIQ2XXSを2GPUで動かしたローカルAI開発環境の記録です。生成速度、DAGと再計画、Djangoモデル生成、ツール抽出の失敗を確認しました。
Step-3.7-Flashのローカル並列エージェント開発
Step-3.7-Flash-NVFP4で6ロールを並列実行し、予約APIと管理画面を生成。AIシステム開発の観測、速度、手修正の結果を記録します。
Gemma 4 31BのvLLM / SGLang比較
Blackwell 96GBでGemma 4 31BのNVFP4・FP8・MTPを比較。LLM導入で見る生成速度、KV容量、coding-agentの出力を記録します。
MiMo V2.5 Proの単一・dual GPU計測
MiMo V2.5 Pro IQ2_SをBlackwell 96GB×1/×2で動かし、decode 12.4–12.5/16.5–16.6 tok/sを測りました。LLM導入に向け、expert配置 …
DeepSeek V4 Flash Q2のDwarfStar 4実測
DeepSeek V4 Flash 284B Q2-imatrixをBlackwell 96GB 1枚で動かし、短文43.6 tok/s、50K contextで31.4 tok/sを測りました。ロー …
Qwen3.6-27BのNVFP4・MTP・LoRA実測
Qwen3.6-27B NVFP4+MTPをvLLMで測定。動的LoRAを使うLLM導入の速度、VRAM、tool errorと未完走の結果を記録します。
DeepSeek-V4-Flashのローカル推論:llama.cppとBlackwell 96GB×2
DeepSeek-V4-Flash(284B MoE / 13B active)をBlackwell Max-Q 96GB×2とllama.cppのWIPブランチで動かしました。ローカルLLM導入に向 …
Qwen3.6-27Bの推論とロール別LoRA計画
Qwen3.6-27B-FP8をSGLangで1日運用し、単発約100 tok/s、2並列合算160–180 tok/sを測りました。LLM導入の開発支援向けに、4ロールのLoRAと評価方法を計画しま …
Kimi-K2.6のCPU / GPU配置とコード生成
Kimi-K2.6のIQ3_KとQ4_Xをik_llama.cppで比較。ローカルLLM導入のexpert配置、生成速度、Django業務システムの生成例を記録します。
NVFP4で翻訳と日本語3文体のデータを生成
CAT-TranslateとLLM-JPで256件を翻訳・言い換えした検証です。AIシステム開発の学習データ準備として、速度、16件の品質評価、Harmony混入、1万件処理の見積もりを記録しました。
GLM-5.1のexpert配置とHybrid推論
GLM-5.1 IQ3_KSをBlackwell 96GB×2と768GB RAMで動かし、TG 17–19 tok/sを測りました。LLM導入向けにexpertの配置と、Qwen3.5との …
MiniMax-M2.7の速度と非商用制限
MiniMax-M2.7をBlackwell 96GB×2で非商用評価し、動画の10点から平均71.9 t/sを読み取りました。LLM評価・推論基盤開発の記録で、商用利用には事前許諾が必要なため常用を …
Qwen3.5-397B-A17BのDjango実装と推論速度
Qwen3.5-397B-A17BのQ4_K_M版(227.5 GiB)をBlackwell 96GB×2で動かし、Djangoの業務システム開発を検証しました。20分・80回のツール呼び出しで実装タ …
GLM-5.1のexpert配置と生成速度
GLM-5.1 IQ3_KSのCPU/GPU配置を測り、21.75 t/sまで改善した記録です。AIシステム開発の並列エージェント基盤として、Qwen3-Coder-NextとのVRAM配分と未検証の …
Dagsterで会話の分岐と評価データを管理する
Go・NATS・Dagsterで会話の再実行、評価、学習データ生成を設計。AIシステム開発のデータ基盤と、レビューで見つかった4つの問題を記録します。
Qwen3.5による6ページの歯科サイト生成
Qwen3.5にHTML、Tailwind CSS、Alpine.jsだけで6ページの歯科サイト生成を依頼しました。Webサイト開発へのローカルLLM利用として、18分2秒の実行記録、モデルの報告、確 …
ローカルLLMのCPU・GPU分担計画
Blackwell 96GBとEPYC 9175Fで、非同期処理と対話を分けるLLM導入計画です。60以上のモデルの試行履歴と、未実装のDagster・日次LoRA構想を示します。
PLAMO向けの日英system prompt
PLAMO-translate AI MODELの英日翻訳と、英訳前の日本語補正用プロンプトです。LLM導入での翻訳処理に向け、識別子の保持、Notes、出力形式を設計しました。
LTX-2の36シーンと継続性を設計する
LTX-2の36シーン構成を、シナリオ・ショット・継続性に分けた設計です。動画生成AIのシステム開発に向け、固定スキーマ、音声、カメラ、連結条件、生成サンプルの不足を整理しました。
Hermes-4.3-36BのBF16・FP8・nvfp4比較
Blackwell 96GBとvLLM 0.14.0rc1で、Hermes-4.3-36Bの3形式を比較しました。LLM導入と開発支援に向け、生成速度、初動、context容量、出力品質を確認します。
IQuest-Coder-40BのCPU・GPU・Aider比較
IQuest-Coder-V1-40BをCPU Q5_K_M、GPU nvfp4、Aider whole-editで計測しました。LLM導入と開発支援に向け、GPUの25–28 tok/sと長い入力・ …
Command A ReasoningをAiderのテスト生成で評価
Command A ReasoningでGoのユニットテストを生成し、Aiderの編集形式違反とtoken limitを記録しました。LLM導入で確認すべきテスト設計と編集ループの安定性を整理します。
Serena MCPとObsidianを使う開発支援の構想
Serena MCP、Obsidian、ローカルLLM、VS Codeをつなぐ構成案。開発業務へのLLM導入に必要な最小構成と未定の設定を整理します。
GLM-4.7-Flash Uncensoredのレビュー評価
GLM-4.7-Flash UncensoredでRustコードのレビューと速度を確認しました。LLM導入の開発支援では観点出しに使えますが、脆弱性の成立条件を人が検証する必要があります。
IQuest-Coder Loop-Instructとaiderの生成速度
IQuest-Coder-V1-40B-Loop-Instructはaiderで0.6〜8 tok/sでした。AIコーディング環境の構築に向け、whole edit、文脈の量、生成設定を分けて考え、別 …
MCPの実行先とVSCode Remote SSH
検証したZedではMCPがMacで起動し、VSCode Remote SSHではcompute側のruntimeを使えました。LLM導入の開発環境に向け、実行先、PATH、Podmanでの起動を整理し …
EPYC 9175FでKimi-K2.5を動かし、L3仮説を見直す
EPYC 9175Fと768GB RAMでKimi-K2.5を実測。スレッド数、128K文脈、prompt cacheから、LLM導入のCPU基盤とL3仮説を検討します。
MiniMax-2.5のExpert OffloadとWebサイト生成
MiniMax-2.5のIQ5_KからIQ3_Sを比較。ローカルLLM導入のExpert配置と、React LP・歯科医院サイトのWeb開発例を記録します。
Qwen3.5-397Bのハイブリッド推論とCMS生成
Qwen3.5-397B IQ4_NLをEPYCとGPUで28回測定し、Django CMSの骨格生成を評価しました。LLM導入とWebシステム開発に向けた速度・構成・修正箇所の記録です。
Llama-4-ScoutのCPU / GPU速度とキャッシュ
CPU Q6_KとGPU nvfp4でLlama-4-Scoutを比較。LLM導入のバッチ・対話処理を分けるため、速度、cache、100k前後の文脈上限を記録します。
Kimi-K2.5のCPU推論とprompt cache
Kimi-K2.5 Q4_K_S/Q4_K_MをEPYC 9175Fで計測しました。LLM導入の非同期処理に向け、th=13の速度、16k入力の待ち時間、LCP cacheとHybridの改善を示しま …
Llama 4 MaverickのQ4・Q8 CPU推論比較
EPYC 9175Fと768GBメモリでLlama 4 MaverickのQ4_K_MとQ8_0を比較しました。LLM導入の選定に向け、速度、TTFT、メモリ、バッチとaiderでの品質の印象を記録し …
Qwen3-Coder-Next 80Bの3構成比較
Qwen3-Coder-NextをBF16 CPU、IQ4_NL Hybrid/GPU、nvfp4で計測しました。LLM導入による開発支援に向け、7.59/59–85/17–100 tok/sの速度と …
GLM-4.7-FlashのCPU・Hybrid・GPU比較
GLM-4.7-Flash IQ5_KでPP 100/1635/3723 tok/s、TG 20/67/99 tok/sを測りました。ローカルLLM導入のモデル配置に向け、Expert Offload …
DeepSeek-V3.2の推論速度とキャッシュ不一致
DeepSeek-V3.2 Specialeのローカルログを分析した記録です。LLM導入の性能検証として、PP・TG、prefix不一致、KV cache、改善案と未確定の原因を整理しました。
Qwen3.5-397Bで静的サイトとDjango CMSを生成
Qwen3.5-397Bへ仕様書を渡し、6ページの静的サイトとDjango CMSを生成。受託開発・業務システム開発へのLLM利用と手修正を記録します。