完全ローカルモデルでNowledge Memを使用する
LM Studio、Ollama、または別のローカルエンドポイントを使用して、メモリ処理、エージェント、埋め込み、および有効化されたエンリッチメントを自分のマシン上に保ちます
Nowledge Memは、あなたの知識とそれを処理するモデル呼び出しの両方を自分のマシン上に保つことができます。 LM StudioやOllamaなどのローカル推論サーバーはループバックエンドポイントを公開し、Memはクラウドモデルプロバイダーの代わりにそのエンドポイントにリクエストを送信します。
このガイドでは、実用的な初期セットアップ、それを検証する方法、およびワークフロー全体を完全ローカルと呼ぶ前に確認すべき境界について説明します。
ここでの完全ローカルの意味
有効化するコンテンツ処理(メモリ整理、エージェント応答、埋め込み、オプションのビジョンまたはOCRを含む)は、同じマシン上の組み込みモデルまたはエンドポイントのみを呼び出す必要があります。 コンテンツはクラウドモデルに送信されず、ローカル障害がクラウドモデルにサイレントにフォールバックしてはなりません。
メモリ処理に使用するモデルを変更するだけでは、有効化されたすべてのワークフローがローカルであることを証明するものではありません。
バージョン0.10以降のMac以外でのローカルAI
バージョン0.10以降、Nowledge MemのゼロPythonローカルランタイムはデスクトップおよびヘッドレスLinuxデプロイメントをカバーしています。 公式DockerイメージにはCPUビルドに加えて、オプトインのCUDAおよびVulkanビルドが含まれています。 Memは個人のハードウェアまたは自分のLinuxサーバーで実行できます。
バンドルされているGemma 4モデルはマルチモーダルです。 ビジョンは現在統合されている部分です。 LibraryはスキャンされたPDF、画像内のテキスト、および視覚的理解を必要とするその他のドキュメントにこれを使用します。 基盤モデルはオーディオの基盤も提供しますが、本番のオーディオルーティング、PIIフィルタリング、およびオーディオ会議処理は、このページで今日提供される機能ではなく、将来の方向性として残っています。
アプリにバンドルされているモデルに加えて、Nowledge MemはLemonade、Ollama、およびLM Studioをファーストクラスのローカルプロバイダーとしてサポートしています。 Lemonade統合に多大な貢献をしてくださったコミュニティコントリビューターでありパワーユーザーであるabnに特別な感謝を捧げます。
始める前に
必要なもの:
- ローカルデスクトップまたはローカルサーバーモードで実行されているNowledge Mem
- Lemonade、LM Studio、またはOllamaなどのローカル推論サーバー
- そのサーバーによってロードされたチャットモデル
- モデルとその他の日常的なアプリケーションに十分なメモリ
LemonadeのデフォルトのOpenAI互換エンドポイントはhttp://127.0.0.1:13305/v1、LM Studioのそれはhttp://127.0.0.1:1234/v1、Ollamaのそれはhttp://127.0.0.1:11434/v1です。
Memとモデルサーバーが異なるコンテナまたは異なるマシンで実行されている場合は、Memが到達できるアドレスを使用してください。
コンテナ内では、127.0.0.1はそのコンテナ自体を指します。
ローカルモデルサーバーを起動する
Lemonade、LM Studio、またはOllamaでモデルをロードし、ローカルサーバーを起動し、そのOpenAI互換/v1エンドポイントが実行されていることを確認します。
サーバーが少なくとも1つのモデルを報告することを確認します:
# Lemonade
curl http://127.0.0.1:13305/v1/models
# LM Studio
curl http://127.0.0.1:1234/v1/models
# Ollama
curl http://127.0.0.1:11434/v1/modelsここで返されるモデルIDは、Memで使用すべき値です。 モデルの表示名から推測しないでください。
Memにプロバイダーを追加する
- 設定 → プロバイダー を開きます。
- Lemonade、LM Studio、またはOllamaを追加します。
- ループバックURLと、サーバーが報告する正確なモデルIDを入力します。
- ローカルサーバーが要求しない限り、APIキーは空のままにします。
- 接続をテストし、プロバイダーを保存します。
別のローカルランタイムを使用する場合は、OpenAI互換カスタムエンドポイント を追加します。 選択したChat CompletionsまたはResponses API形式を実装している必要があります。
有効化されたすべてのモデル用途をルーティングする
プロバイダーのセットアップとワークロードのルーティングは別々です。 プロバイダー画面で、各用途を確認します:
| 用途 | 完全ローカルの選択肢 | 影響する内容 |
|---|---|---|
| デフォルト | ローカルプロバイダー | ほとんどのBackground Intelligenceタスク、および「デフォルトと同じ」に設定された公開された用途 |
| エージェント | ローカルプロバイダー、またはデフォルトがローカルの場合は「デフォルトと同じ」 | AI Now、Timelineチャット、ブラウザ拡張機能エージェント、およびその他のインタラクティブなエージェントワークフロー |
| 埋め込み | 組み込みローカル | 検索インデックス作成とベクトル検索 |
| ビジョン / OCR | 組み込みローカルビジョンまたはローカルビジョン対応プロバイダー。それ以外の場合はこれらのワークフローを未使用のままにする | Libraryで使用される画像理解とOCRリクエスト |
| 高速判断 | オフのままにする(古いバージョンでは「未設定」) | TypeSafe AIはリモートです。デフォルトがLM Studioなどのローカルプロバイダーを使用している場合でも、この割り当てを確認してください |
埋め込み を 組み込みローカル に保つことが最も簡単なローカルセットアップです。 別の埋め込みモデルまたは次元に切り替える場合は、検索結果を判断する前に再インデックスのプロンプトに従ってください。
2つの高度な構造化レーン、ナレッジグラフ抽出とメモリ圧縮は、内部のbackground_structuredオーバーライドを使用できます。
そのオーバーライドが設定されていない場合、それらは デフォルト を通じてフォールバックします。
バックグラウンドで実行されるという理由だけで エージェント を使用することはありません。
テキストモデルは自動的にビジョンモデルにはならない
外部のローカルモデルが画像を処理できない場合は、それをビジョン またはOCRに割り当てて、それらの機能がカバーされていると仮定しないでください。 組み込みのローカルビジョン モデル、別のローカルビジョン対応モデルを使用するか、画像ワークフローを無効のままにしてください。 新しいエンリッチメント機能を有効にするたびに、ルートを再度確認してください。
セットアップを検証する
小さく観察可能なテストを使用します:
- 設定 → プロバイダー ですべてのクラウドプロバイダーを切断または無効にします。
- ローカル推論サーバーのリクエストログを表示したままにします。
- 1つの永続的な設定と1つの一時的なノイズを含むテストメモリを作成します。
- 関連するBackground Intelligenceアクションを実行し、AI Nowに永続的な設定を取得するよう依頼します。
- リクエストがローカルサーバーログにのみ表示され、結果が期待どおりに保存または返されることを確認します。
- ローカルサーバーを停止し、もう一度繰り返します。 アクションは目に見えて失敗するはずです。 クラウドフォールバックを通じて成功してはなりません。
成功とは、ローカルサーバーがリクエストを処理し、Memが期待される出力を生成し、リモートプロバイダーが使用されなかったことを意味します。
モデルサイジング: あるユーザーのApple Siliconベンチマーク
コミュニティメンバーのVersunは、M4 Proと64 GBのユニファイドメモリを搭載したMac miniで3つの4ビットモデルをテストしました。 3つすべてが同じ制御されたメモリ整理タスクを3回パスしました。 違いは主にレイテンシとメモリ使用量であり、知能の広範な尺度ではありませんでした。
| モデル | コールドロード | 常駐メモリタスク | 長入力TTFT | LM Studio合計ピークRSS |
|---|---|---|---|---|
| Gemma 4 12B GGUF | 3.82 s | 7.38 s | 36.79 s | 10.65 GiB |
| Gemma 4 26B-A4B MLX | 8.17 s | 2.68 s | 13.83 s | 17.69 GiB |
| Qwen3.6 35B-A3B MLX | 11.55 s | 2.64 s | 9.87 s | 17.72 GiB |
彼の実用的な選択は次のとおりでした:
- 32 GB未満: 12B GGUFモデルは他のアプリケーションのためのより多くの余地を残します。
- 32 ~ 64 GB: 26B-A4B MLXモデルはより安全なバランスです。
- 64 GBと常駐モデル: 35B-A3B MLXモデルはこのテストで全体的に最高のレイテンシを示しました。
- 頻繁なロードとアンロード: 26B-A4Bモデルはロードとタスクの合計時間がより低かったです。
これらの結果は、1台のマシン、1つのランタイムバージョン、および1つの固定プロンプトから得られたものです。 共有メモリページにより、合計RSSが空きシステムメモリの正確な減少量よりも大きくなることもあります。 表をサイジングの参考として扱い、自分のワークロードをテストしてください。
Versunの元の中国語ベンチマークまたはNowledge Labsブログのフォーマットされた再公開をお読みください。
確認すべきプライバシー境界
ローカルモデルエンドポイントは推論をローカルに保ちますが、他の製品機能は依然としてネットワークを使用できます:
- 高速判断を個別に確認してください。 デフォルトにLM StudioまたはOllamaを使用しても、TypeSafe AIまたはNowledge AIの判断呼び出しがローカルになるわけではありません。 完全ローカル推論の場合は、この設定をオフのままにしてください。
- 同期とリモートアクセスは、それらの機能に必要なデータを設定したサービスに送信します。
- ブラウザコネクタとインポートは、ソースサービスからコンテンツを取得します。
- 更新、サインイン、および外部リンクは、それぞれのサービスに連絡する場合があります。
- 別のデバイス上のカスタムエンドポイントはセルフホストですが、もはや同じマシン上にはありません。
要件が単にローカル推論ではなくオフラインマシンである場合は、同期とリモートプロバイダーを無効にし、ネットワークを切断し、上記の検証を再実行してください。
トラブルシューティング
Memがモデルを一覧表示できない
モデルサーバーが実行されていること、およびURLが/v1で終わっていることを確認してください。
Memをデバッグする前に、/v1/modelsに対してcurlを使用してください。
接続は機能するが、エージェントタスクが失敗する
モデルがそのワークフローに必要な動作をサポートしていない可能性があります。 AI Now、Timelineチャット、または別のインタラクティブエージェントの場合は、エージェント を確認してください。 Background Intelligenceの場合は、デフォルト を確認し、どのタスクが失敗したかを調べてください。
最初のリクエストがはるかに遅い
それは通常コールドロードです。 ランタイムと利用可能なメモリが許せば、モデルを常駐させておいてください。 コールドロード時間は定常状態のリクエストとは別に測定してください。
埋め込みを切り替えた後に検索が変わった
異なるモデルまたは次元の埋め込みベクトルは互換性がありません。 要求された再インデックスを完了し、検索を再度テストしてください。
次に、プロバイダー固有の設定とコンテキストウィンドウのガイダンスについては、LLMプロバイダーを参照してください。
