kumyu.Learn
← KumyuホームEnglish ↗

登録済みタグ

ローカル推論

モデルを手元で動かし、メモリ、文脈長、時間を確認する。

公開 更新
入門

ローカルLLMを遅くしないための量子化・KV cache・実行系

モデルの重み、作業メモリ、生成速度を別々に見て、MLX・llama.cpp・vLLMを選び、手元で再現できる評価手順へ落とす。

6 分↗
公開 更新
入門

モデル・token・推論を理解する

文章から数値、数値から次のtokenという処理を追う。

4 分↗
公開 更新
入門

MiniMaxとローカルLLMの選び方:open weights、API、実行可能性を分ける

公開リポジトリ、重み、API提供、推論サーバーを混同せず、MiniMaxを含むモデル候補を安全に比較するための調査と実験の教科書。

5 分↗
公開 更新
入門

24GB・32GB Macのメモリを見積もる

重み、KV cache、作業領域、OSを別々に予算化する。

5 分↗
公開 更新
入門

Hugging Faceとモデルファイルの読み方

モデルの入手元、形式、ライセンスを確認して再現可能にする。

4 分↗
公開 更新
入門

小さなLLMをローカルで動かす

最初の目的は高性能な回答ではなく、安全に入出力と資源を観察すること。

4 分↗
公開 更新
中級 → ローカル配信の根拠設計

ローカルモデル実行基盤の根拠を読む:Strataの説明をそのまま引き継がない

日付付きのローカル実行基盤リリースを、コードと重みの権利、ローカル公開範囲、配布物、著者測定、境界付き確認表に分けて読む。

5 分↗
公開 更新
入門

RAG:知識を重みに詰め込まず参照する

更新される事実や出典が必要な質問を、検索と生成に分ける。

3 分↗
公開 更新
入門

画像・3DとローカルAIをつなぐ

共通の計算資源の考え方を使い、制作パイプラインの違いを理解する。

4 分↗
公開 更新
入門

実験を記録し、サービスに組み込む

小さな実験を再現可能な判断と安全な運用へつなげる。

7 分↗
公開 更新
中級 → 配信設計

vLLM 0.29–0.30: ランナーのデフォルト変更を配信境界の変更として扱う

vLLM のランナー、待ち行列、ルート認可の変更を、採用前に検証するための日時付き更新ノート。

4 分↗
公開 更新
中級 → 信頼性の評価

llama.cpp b11377: JSON Schema 出力をパーサー固有の契約として扱う

Ling 3.0 の response_format の穴を直す prerelease を、固定したパーサー固有の検証でだけ採用する。

6 分↗
公開 更新
中級 → 判断の評価

llama.cpp /v1/systemone:ローカルの判断用エンドポイントを振り分けの手掛かりにする

日付を確認したローカル GGUF の判断用エンドポイントは型付き確率を返すが、操作の権限を与えるものではない。

5 分↗
公開 更新
中級 → GPU 障害の診断

llama.cpp CUDA MoE:一時バッファの次元をテスト境界として扱う

限定的な事前リリースの修正から、MoE の CUDA 検証ではテンソル形状、バックエンド、失敗状態を固定してから配備を変える理由を学ぶ。

5 分↗
公開 更新
中級

動画モデル調査ノート:2025年以降の提供形態と制作上の選び方

Veo、Sora、Wan、LTXを公式資料で確認し、クラウド提供・open weights・推論コード・安全策を別軸で比較する。

6 分↗
公開 更新
入門 → 制作・納品の判断

ローカル生成とSunoを使い分ける

生成の場所、編集できる範囲、持ち出す形式を先に確かめる

5 分↗