Logo loFT LLC

    • Webサイトのリニューアルと技術記事の公開
    • 子会社Lorchestra株式会社の吸収合併
    • IT導入支援事業者への採択(2022年度)
    • IT導入支援事業者への採択(2021年度)
    • 子会社Lorchestra株式会社の設立
    • IT導入支援事業者への採択(2020年度)
    • loFT合同会社の設立
      • Dagster と NATS JetStream で後処理を分離する
      • PostgreSQLを常時稼働のstorageに移す
      • Dagsterの実験記録にMLflowとMinIOを追加
      • Vector移行と3ホスト基盤の設定整理
      • PostgreSQL 18とpgvectorのrootless Quadlet構成
      • EPYC 9175Fワークステーションの構成検討
      • NVMe・SATA と管理 UI の配置方針
      • 監視画面をキーボードで使う QuteBrowser 設定
      • CRS304のVLAN分離とLinuxの外向き通信
      • RouterOSでSyslog停止中のカウンタを保存
      • PodmanとQuadletのUID・名前解決
      • Prometheus・Loki と Quadlet による監視基盤
      • smartctl-exporterとrootful / rootlessの運用整理
      • EPYCとPodmanのローカル開発基盤
      • Ubuntu最小構成でのQuadlet運用
      • EPYC単機のELTメモリ割り当て
      • rootless Podmanのバックアップと復旧設計
      • vLLM・llama.cpp とプロキシの Compose 構成
      • Hugging Faceモデルのcold・hot間転送
      • OpenAI 互換プロキシを Rust から Go に移した理由
      • Go・NATS・DagsterのAI実行基盤
      • familiarのローカルLLM開発基盤と観測
      • familiarのタスク分割とoutput_file
      • llm-jpの翻訳を常駐からバッチへ
      • agent-gatewayのRAGとイベント処理
      • Gemma 4とBlackwell 2枚の推論基盤
      • agent-gatewayの全レイヤー整理
      • agent-gateway v3 のドメイン分割と MLflow 連携
      • RustとONNXで組むembedding・rerank API
      • WordPressに近いDjangoブログ基盤の設計
      • Qwen3.5でDjango旅行予約サイトを生成
      • Jev-Omniのマルチモーダル判定とClefとの比較
      • DeepSeek Harnessのローカル実行構成
      • DeepSeek V4 Flash 0731のvLLM実測とCPU KV offload
      • GLM-5.2 GGUFの量子化・MTP・expert配置を比較
      • DeepSeek-V4-FlashをDwarfStar4の2ノードで評価
      • Step-3.7-Flashのローカル並列エージェント開発
      • Gemma 4 31BのvLLM / SGLang比較
      • MiMo V2.5 Proの単一・dual GPU計測
      • DeepSeek V4 Flash Q2のDwarfStar 4実測
      • Qwen3.6-27BのNVFP4・MTP・LoRA実測
      • DeepSeek-V4-Flashのローカル推論:llama.cppとBlackwell 96GB×2
      • Qwen3.6-27Bの推論とロール別LoRA計画
      • Kimi-K2.6のCPU / GPU配置とコード生成
      • NVFP4で翻訳と日本語3文体のデータを生成
      • GLM-5.1のexpert配置とHybrid推論
      • MiniMax-M2.7の速度と非商用制限
      • Qwen3.5-397B-A17BのDjango実装と推論速度
      • GLM-5.1のexpert配置と生成速度
      • Dagsterで会話の分岐と評価データを管理する
      • Qwen3.5による6ページの歯科サイト生成
      • ローカルLLMのCPU・GPU分担計画
      • PLAMO向けの日英system prompt
      • LTX-2の36シーンと継続性を設計する
      • Hermes-4.3-36BのBF16・FP8・nvfp4比較
      • IQuest-Coder-40BのCPU・GPU・Aider比較
      • Command A ReasoningをAiderのテスト生成で評価
      • Serena MCPとObsidianを使う開発支援の構想
      • GLM-4.7-Flash Uncensoredのレビュー評価
      • IQuest-Coder Loop-Instructとaiderの生成速度
      • MCPの実行先とVSCode Remote SSH
      • EPYC 9175FでKimi-K2.5を動かし、L3仮説を見直す
      • MiniMax-2.5のExpert OffloadとWebサイト生成
      • Qwen3.5-397Bのハイブリッド推論とCMS生成
      • Llama-4-ScoutのCPU / GPU速度とキャッシュ
      • Kimi-K2.5のCPU推論とprompt cache
      • Llama 4 MaverickのQ4・Q8 CPU推論比較
      • Qwen3-Coder-Next 80Bの3構成比較
      • GLM-4.7-FlashのCPU・Hybrid・GPU比較
      • DeepSeek-V3.2の推論速度とキャッシュ不一致
      • Qwen3.5-397Bで静的サイトとDjango CMSを生成
      • shelpa-mcpの仮想パイプラインとCWD管理
      • shelpaのパス制限・監査ミラーと廃止の理由
      • homelabで使う9本のRust製MCPサーバー
      • voracleのresearchを開発フローに組み込む
      • shelpaからfilesystemへ: ファイル操作と復旧の再設計
      • voracleでObsidianを検索し、LLM会話を取り込む
      • aichatのsymlink環境でfunction callingが止まる原因
      • pathfinderのMCP応答を変えて精度を比較
      • pathfinderのパス解決とMCP検証
      • ctreeのAST解析とMCP連携
  • 新着ノート一覧
  • プロフィール
  • 写真
    Logo
    ご相談はこちらから
      • English
    • 移動
    • 選択
    • 閉じる
      • Home
      • 開発ノート
      • LLM リサーチ
      On this page

      LLM リサーチ

      大規模言語モデルのベンチマーク、CPU/GPU推論検証、最適化リサーチ。

      技術メモとして残していた ObsidianノートにAIの要約を利用しています。

      Qwen3.5でDjango旅行予約サイトを生成

      Qwen3.5-122B-A10BとMCPによるローカルWebアプリ開発の検証です。旅行予約、管理画面、6アプリへの拡張を扱い、業務システム開発での生成範囲と必要だった手修正を記録しました。

      Jev-Omniのマルチモーダル判定とClefとの比較

      音声、画像、日本語メール、動画の35件でJev-Omniを評価し、同じ25件でClefと比較しました。AIシステム開発に向けた選択肢判定の検証です。追加の動画実験と各入力への回答も掲載しています。

      DeepSeek Harnessのローカル実行構成

      DeepSeek-V4-Flash-Vision-ExpとV4.1-FlashをRTX PRO 6000 Max-Q 2枚で使いました。LLM導入に向け …

      DeepSeek V4 Flash 0731のvLLM実測とCPU KV offload

      RTX PRO 6000 96GB 2枚でDeepSeek V4 Flash 0731を実測。DSpark K5の速度、CPU KV offload、業務システム開発の生成例を記録します。

      GLM-5.2 GGUFの量子化・MTP・expert配置を比較

      GLM-5.2 GGUFの1.630bpwと2.244bpwを192GB VRAMで比較。LLM導入の速度・品質・省VRAM構成とMTPの実測を記録します。

      DeepSeek-V4-FlashをDwarfStar4の2ノードで評価

      DeepSeek-V4-FlashのIQ2XXSを2GPUで動かしたローカルAI開発環境の記録です。生成速度、DAGと再計画、Djangoモデル生成、ツール抽出の失敗を確認しました。

      Step-3.7-Flashのローカル並列エージェント開発

      Step-3.7-Flash-NVFP4で6ロールを並列実行し、予約APIと管理画面を生成。AIシステム開発の観測、速度、手修正の結果を記録します。

      Gemma 4 31BのvLLM / SGLang比較

      Blackwell 96GBでGemma 4 31BのNVFP4・FP8・MTPを比較。LLM導入で見る生成速度、KV容量、coding-agentの出力を記録します。

      MiMo V2.5 Proの単一・dual GPU計測

      MiMo V2.5 Pro IQ2_SをBlackwell 96GB×1/×2で動かし、decode 12.4–12.5/16.5–16.6 tok/sを測りました。LLM導入に向け、expert配置 …

      DeepSeek V4 Flash Q2のDwarfStar 4実測

      DeepSeek V4 Flash 284B Q2-imatrixをBlackwell 96GB 1枚で動かし、短文43.6 tok/s、50K contextで31.4 tok/sを測りました。ロー …

      Qwen3.6-27BのNVFP4・MTP・LoRA実測

      Qwen3.6-27B NVFP4+MTPをvLLMで測定。動的LoRAを使うLLM導入の速度、VRAM、tool errorと未完走の結果を記録します。

      DeepSeek-V4-Flashのローカル推論:llama.cppとBlackwell 96GB×2

      DeepSeek-V4-Flash(284B MoE / 13B active)をBlackwell Max-Q 96GB×2とllama.cppのWIPブランチで動かしました。ローカルLLM導入に向 …

      Qwen3.6-27Bの推論とロール別LoRA計画

      Qwen3.6-27B-FP8をSGLangで1日運用し、単発約100 tok/s、2並列合算160–180 tok/sを測りました。LLM導入の開発支援向けに、4ロールのLoRAと評価方法を計画しま …

      Kimi-K2.6のCPU / GPU配置とコード生成

      Kimi-K2.6のIQ3_KとQ4_Xをik_llama.cppで比較。ローカルLLM導入のexpert配置、生成速度、Django業務システムの生成例を記録します。

      NVFP4で翻訳と日本語3文体のデータを生成

      CAT-TranslateとLLM-JPで256件を翻訳・言い換えした検証です。AIシステム開発の学習データ準備として、速度、16件の品質評価、Harmony混入、1万件処理の見積もりを記録しました。

      GLM-5.1のexpert配置とHybrid推論

      GLM-5.1 IQ3_KSをBlackwell 96GB×2と768GB RAMで動かし、TG 17–19 tok/sを測りました。LLM導入向けにexpertの配置と、Qwen3.5との …

      MiniMax-M2.7の速度と非商用制限

      MiniMax-M2.7をBlackwell 96GB×2で非商用評価し、動画の10点から平均71.9 t/sを読み取りました。LLM評価・推論基盤開発の記録で、商用利用には事前許諾が必要なため常用を …

      Qwen3.5-397B-A17BのDjango実装と推論速度

      Qwen3.5-397B-A17BのQ4_K_M版(227.5 GiB)をBlackwell 96GB×2で動かし、Djangoの業務システム開発を検証しました。20分・80回のツール呼び出しで実装タ …

      GLM-5.1のexpert配置と生成速度

      GLM-5.1 IQ3_KSのCPU/GPU配置を測り、21.75 t/sまで改善した記録です。AIシステム開発の並列エージェント基盤として、Qwen3-Coder-NextとのVRAM配分と未検証の …

      Dagsterで会話の分岐と評価データを管理する

      Go・NATS・Dagsterで会話の再実行、評価、学習データ生成を設計。AIシステム開発のデータ基盤と、レビューで見つかった4つの問題を記録します。

      Qwen3.5による6ページの歯科サイト生成

      Qwen3.5にHTML、Tailwind CSS、Alpine.jsだけで6ページの歯科サイト生成を依頼しました。Webサイト開発へのローカルLLM利用として、18分2秒の実行記録、モデルの報告、確 …

      ローカルLLMのCPU・GPU分担計画

      Blackwell 96GBとEPYC 9175Fで、非同期処理と対話を分けるLLM導入計画です。60以上のモデルの試行履歴と、未実装のDagster・日次LoRA構想を示します。

      PLAMO向けの日英system prompt

      PLAMO-translate AI MODELの英日翻訳と、英訳前の日本語補正用プロンプトです。LLM導入での翻訳処理に向け、識別子の保持、Notes、出力形式を設計しました。

      LTX-2の36シーンと継続性を設計する

      LTX-2の36シーン構成を、シナリオ・ショット・継続性に分けた設計です。動画生成AIのシステム開発に向け、固定スキーマ、音声、カメラ、連結条件、生成サンプルの不足を整理しました。

      Hermes-4.3-36BのBF16・FP8・nvfp4比較

      Blackwell 96GBとvLLM 0.14.0rc1で、Hermes-4.3-36Bの3形式を比較しました。LLM導入と開発支援に向け、生成速度、初動、context容量、出力品質を確認します。

      IQuest-Coder-40BのCPU・GPU・Aider比較

      IQuest-Coder-V1-40BをCPU Q5_K_M、GPU nvfp4、Aider whole-editで計測しました。LLM導入と開発支援に向け、GPUの25–28 tok/sと長い入力・ …

      Command A ReasoningをAiderのテスト生成で評価

      Command A ReasoningでGoのユニットテストを生成し、Aiderの編集形式違反とtoken limitを記録しました。LLM導入で確認すべきテスト設計と編集ループの安定性を整理します。

      Serena MCPとObsidianを使う開発支援の構想

      Serena MCP、Obsidian、ローカルLLM、VS Codeをつなぐ構成案。開発業務へのLLM導入に必要な最小構成と未定の設定を整理します。

      GLM-4.7-Flash Uncensoredのレビュー評価

      GLM-4.7-Flash UncensoredでRustコードのレビューと速度を確認しました。LLM導入の開発支援では観点出しに使えますが、脆弱性の成立条件を人が検証する必要があります。

      IQuest-Coder Loop-Instructとaiderの生成速度

      IQuest-Coder-V1-40B-Loop-Instructはaiderで0.6〜8 tok/sでした。AIコーディング環境の構築に向け、whole edit、文脈の量、生成設定を分けて考え、別 …

      MCPの実行先とVSCode Remote SSH

      検証したZedではMCPがMacで起動し、VSCode Remote SSHではcompute側のruntimeを使えました。LLM導入の開発環境に向け、実行先、PATH、Podmanでの起動を整理し …

      EPYC 9175FでKimi-K2.5を動かし、L3仮説を見直す

      EPYC 9175Fと768GB RAMでKimi-K2.5を実測。スレッド数、128K文脈、prompt cacheから、LLM導入のCPU基盤とL3仮説を検討します。

      MiniMax-2.5のExpert OffloadとWebサイト生成

      MiniMax-2.5のIQ5_KからIQ3_Sを比較。ローカルLLM導入のExpert配置と、React LP・歯科医院サイトのWeb開発例を記録します。

      Qwen3.5-397Bのハイブリッド推論とCMS生成

      Qwen3.5-397B IQ4_NLをEPYCとGPUで28回測定し、Django CMSの骨格生成を評価しました。LLM導入とWebシステム開発に向けた速度・構成・修正箇所の記録です。

      Llama-4-ScoutのCPU / GPU速度とキャッシュ

      CPU Q6_KとGPU nvfp4でLlama-4-Scoutを比較。LLM導入のバッチ・対話処理を分けるため、速度、cache、100k前後の文脈上限を記録します。

      Kimi-K2.5のCPU推論とprompt cache

      Kimi-K2.5 Q4_K_S/Q4_K_MをEPYC 9175Fで計測しました。LLM導入の非同期処理に向け、th=13の速度、16k入力の待ち時間、LCP cacheとHybridの改善を示しま …

      Llama 4 MaverickのQ4・Q8 CPU推論比較

      EPYC 9175Fと768GBメモリでLlama 4 MaverickのQ4_K_MとQ8_0を比較しました。LLM導入の選定に向け、速度、TTFT、メモリ、バッチとaiderでの品質の印象を記録し …

      Qwen3-Coder-Next 80Bの3構成比較

      Qwen3-Coder-NextをBF16 CPU、IQ4_NL Hybrid/GPU、nvfp4で計測しました。LLM導入による開発支援に向け、7.59/59–85/17–100 tok/sの速度と …

      GLM-4.7-FlashのCPU・Hybrid・GPU比較

      GLM-4.7-Flash IQ5_KでPP 100/1635/3723 tok/s、TG 20/67/99 tok/sを測りました。ローカルLLM導入のモデル配置に向け、Expert Offload …

      DeepSeek-V3.2の推論速度とキャッシュ不一致

      DeepSeek-V3.2 Specialeのローカルログを分析した記録です。LLM導入の性能検証として、PP・TG、prefix不一致、KV cache、改善案と未確定の原因を整理しました。

      Qwen3.5-397Bで静的サイトとDjango CMSを生成

      Qwen3.5-397Bへ仕様書を渡し、6ページの静的サイトとDjango CMSを生成。受託開発・業務システム開発へのLLM利用と手修正を記録します。

      © 2017-2026 loFT LLC

      プライバシーポリシー セキュリティホワイトペーパー