リリースは、結果を引き継ぐ根拠ではなく、確認すべき条件表である
Strata v0.1.39 は 2026-10-04 12:32:47 UTC に公開された。これは、文書でQwen3.8-Flash-Nextと結び付けられているローカル実行基盤の、日付を確認できるリリースである。ただし、この事実だけで別の機械でも収まる、速い、安全、または十分な回答を返すとはいえない。
リリースの 著者測定 は、RTX 5070上で0.1.38と交互に実行した組のデコードを比較している。長いプロンプトの事例にはVRAMとexpert cacheの条件がある。その条件を結果から切り離さない。一台の機械での測定は、別の機械と作業への配備判断には答えない。Hacker News投稿者による別の速度報告も、コミュニティの自己申告であり、ここでの主張には使わない。
- 1リリースタグとasset digest
- 2読んだ対象を特定
- 3安全性の署名ではない
- 1コードのライセンス
- 2実行基盤コードの許可
- 3各重みとは別に確認
- 1モデルカードと重みの条件
- 2特定の重みを取得できるか判断
- 3コードMITから推測しない
- 1固定した機械と作業負荷
- 2ローカルで反復確認
- 3収まり、待ち時間、失敗、出力検査を記録
- 1境界が欠ける
- 2unknown または停止
- 3別の実行基盤やクラウドAPIで代用しない
これは独自の概念図である。配布ページ、コードのライセンス、処理速度は、それぞれ別の問いへ答えることを示している。
三つの成果物には、三つの契約がある
リポジトリはStrataのコードについてMITライセンスを示している。一方、実行基盤のREADMEは、構成要素と各モデルには別々のライセンスがあり得ると説明する。Qwenのモデルカードで見えるメタデータはモデルのライセンスをotherと示すが、これは特定の量子化、再配布、出力、商用利用の詳細な許可にはならない。重みを取得する前に、名前が一致するモデルカード、配布物、その時点の条件を読む。実行基盤コードのMITは、モデル重みへ移らない。
v0.1.39には標準Windows、実験的なCUDA 12、HIPのZIPとSHA-256 digestが挙げられ、一部のハードウェア経路は未検証と記されている。ダウンロードした内容を公開値と比較すれば、バイト列の同一性を確認できる。信頼できる作成者、マルウェアの有無、platformへの適合はそれだけでは確立しない。自分の判断のため、実行を検討する前にOS、GPU世代、ドライバ、RAM、VRAM、モデル形式を記録する。
リリースはOpenAI、Anthropic、Responses形式のHTTP経路と、未対応のResponses機能を記している。経路名の一致は、契約を確認する出発点として扱う。クライアントが必要とする欄と状態の振る舞いを特定し、その版の仕様と照合し、差がある場合の明示的な失敗を定義する。後で機密でない入力を試す場合も、それ用に認可された環境が必要になる。
ローカル公開にも権限境界がある
リリースは既定のloopback bind、任意の広いhost bind、API key、Host/Origin検査、CORS、opt-in MCP toolsを説明する。これらは著者が文書化した制御であり、ここで実施した安全性評価ではない。ローカルendpointでも、明示的にloopback外へbindした場合、鍵を使い回す場合、またはクライアントにタスク以上の権限を与えた場合には、非公開のプロンプト、ツール、ファイルを公開し得る。
READMEにはAI支援によるsetup経路もある。これは信頼の判断を変える。指示により、agentがハードウェアを調べ、大きな重みをダウンロードし、ローカルファイルを変え、serverを起動し、toolsを接続する可能性がある。リポジトリの指示を認可と扱わない。まず指示を読み、許すファイルシステム、ネットワーク、プロセス、ツールの範囲を決める。その後、承認した操作だけを自分で行うか、境界を定めた自動化ポリシーで実行する。この教材ではassetや重みのダウンロード、binary実行、server起動、API呼び出し、ライセンス受諾を行っていない。
| 判断 | 実行前に必要な根拠 | 停止する条件 |
|---|---|---|
| 実行基盤コードを取得 | 正確なタグ、コードのライセンス、asset digest、対象platform | ライセンスまたはassetの同一性が不明 |
| 重みを取得 | 正確な配布物、モデルカードの条件、disk/RAM/VRAM予算 | 条件または配布物の版が不明 |
| ローカルserviceを開始 | bind address、認証、client範囲、logの置き場 | 未承認のデータを受ける、またはtoolsを公開し得る |
| 性能を比較 | 固定したruntime/model/quantization、同一作業負荷、反復、測定値 | ハードウェア、プロンプト長、cache状態、失敗の分母が異なる |
自分の機械のための、未実行N=1確認表
これはオフラインの確認表であり、導入手順や測定済み結果ではない。一つの架空JSON抽出課題を使い、Strata、Qwen、ローカルserver、APIを呼び出さない。
- 想定する実行基盤タグ、候補の重みの版とライセンスURL、量子化ファイルのhash、OS、GPU/driver、RAM、VRAM、context上限、prompt、期待するJSON schema、最大経過時間を一つの記録に書く。得られない欄は
unknownとする。 - 架空の入力を三つ作る。一つは正しいレコード、一つは必須欄が欠けたレコード、一つはデータ内でschemaを無視するよう求める指示を含むレコードである。JSONのparse、必須欄、埋め込まれた指示を拒否することを、決定的に検査する。
- endpointを呼ばず、仮想的な結果行を三つだけ記録する。parseでき、検査を満たす
pass、形式不正または検査失敗のreject、timeout・out-of-memory・実行基盤未導入・測定値欠落のunknownである。失敗を平均から消さない。 - 後で別途承認されて実行する場合は、同じ記録で最大三回だけ反復する。runtime/model/quantizationの識別子、warm/cold状態、入出力token数、経過時間、観測できる場合のpeak memory、出力検査結果、すべての失敗を残す。基準を記録してから一条件だけ変える。
ここから出せる結論は狭い。この正確な設定が、記録した条件でこれらの架空ケースを処理できた、またはできなかった、までである。モデル品質、安全性、一般的なAPI互換性、費用、実データ利用の権限は示さない。メモリと処理速度の変数は既存の量子化、KV cache、runtimeの章で、モデルの信号が副作用を認可しない原則はlocal decision endpointの確認表で補う。
この特定のリリースと配布物の判断に、必要な2024〜2025年の歴史資料はない。一般的なローカルLLM年表は、ここでのコードと重み、assetとdigest、ローカルbindの境界を明確にしない。日付付きの直近一次資料はこのリリースであり、日付不明のリポジトリ、ライセンス、モデルカードは現時点の運用条件を示すだけである。
MENTAL MODEL / メモリ
モデルの重さを、分けて考える。
重みとKVキャッシュは別々に増える。下の値は設計用の概算です。
GBは10⁹ byte。KVは32層・8 KV heads・128 head dim・FP16・batch 1の仮定。量子化メタデータ、実行バッファ、OS、モデル固有の構造は別途必要。MoEでは総重みとactive parametersを分けます。
出典
公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。