登録済みタグ
ローカル推論
モデルを手元で動かし、メモリ、文脈長、時間を確認する。
公開 更新
6 分↗
公開 更新
入門
MiniMaxとローカルLLMの選び方:open weights、API、実行可能性を分ける
公開リポジトリ、重み、API提供、推論サーバーを混同せず、MiniMaxを含むモデル候補を安全に比較するための調査と実験の教科書。
5 分↗
公開 更新
中級 → ローカル配信の根拠設計
ローカルモデル実行基盤の根拠を読む:Strataの説明をそのまま引き継がない
日付付きのローカル実行基盤リリースを、コードと重みの権利、ローカル公開範囲、配布物、著者測定、境界付き確認表に分けて読む。
5 分↗
公開 更新
4 分↗
公開 更新
中級 → 信頼性の評価
llama.cpp b11377: JSON Schema 出力をパーサー固有の契約として扱う
Ling 3.0 の response_format の穴を直す prerelease を、固定したパーサー固有の検証でだけ採用する。
6 分↗
公開 更新
中級 → 判断の評価
llama.cpp /v1/systemone:ローカルの判断用エンドポイントを振り分けの手掛かりにする
日付を確認したローカル GGUF の判断用エンドポイントは型付き確率を返すが、操作の権限を与えるものではない。
5 分↗
公開 更新
中級 → GPU 障害の診断
llama.cpp CUDA MoE:一時バッファの次元をテスト境界として扱う
限定的な事前リリースの修正から、MoE の CUDA 検証ではテンソル形状、バックエンド、失敗状態を固定してから配備を変える理由を学ぶ。
5 分↗
公開 更新
6 分↗