mac-local-vision: macOSエージェント用のコンパクトなオンデバイスビジョンサーバー
mac-local-visionは、Junmo Kimによって開発された軽量のModel Context ProtocolサーバーおよびCLIで、macOSアプリにAIエージェントと自動化のためのデバイス上の視覚的コンテキストを提供します。これは、AppleのVisionおよびFoundationModelsをローカルで実行し、OCR、画像分類、バーコードデコーディング、UIローカリゼーションをエージェントツール用に低遅延で行います。主な機能には、ゼロトークンのローカルOCR、ピクセル単位のテキスト座標、構造化文書抽出、顔のグルーピングが含まれます。開発者、QAエンジニア、およびプライバシーを重視するユーザーは、Macエージェントのワークフローのためにプライベートでハードウェアアクセラレーションされた視覚を得ることができます。
それはサブ秒、ハードウェアアクセラレーションされた視覚認識を実現します
このツールは、外部のランタイム依存関係がない、約550 KBの単一の純粋なSwiftバイナリで、ネイティブのVisionおよびFoundationModelsフレームワークを使用しています。この設計は、一般的なタスクに対して非常に低いレイテンシを生み出し、OCRは約0.3sと報告されています。このアプリは、Visionがサポートする1Dおよび2Dバーコードを1回の呼び出しでデコードし、撮影されたページをフラットにするための文書の補正を行い、すべてのデータをマシンの外に送信することなく処理します。
出力は自動化および検証ワークフローのために構造化されています
mac-local-visionは、自動テストおよびエージェントアクションに適したマシンフレンドリーな出力を返します:特定の単語をクリックまたは主張するためのピクセル正確な座標を提供し、タイトル、段落、表、リストを保持する構造化された文書OCRを提供します。画像分類は、1,300を超えるラベルの分類法を使用し、ローカルの顔グループ化は人ごとに写真をクラスタリングします。内蔵のMCPサーバーは、エージェントパイプラインへの統合のためにstdioおよびHTTP JSON-RPCをサポートしています。
プライバシー優先の設計とプラットフォームの制約が実用的な使用を形作ります
このアプリは、画像を完全にローカルのMac上で処理するため、視覚データはデバイスから外に出ず、クラウドトークンは必要ありません。Apple Siliconを対象としており、macOS 26以降が必要です。ベータaskコマンドを含むいくつかのマルチモーダル機能には、macOS 27ベータおよびApple Intelligenceが必要です。デプロイメントにはMCP互換のクライアントが必要で、Homebrew、miseツール、または事前構築されたバイナリのダウンロードを介してインストールできます。
MacファーストのエージェントとQAワークフローのための集中した選択肢
mac-local-visionは、MCPベースのエージェントツールチェーンにローカルな視覚コンテキストを組み込み、Mac専用のデプロイメントを受け入れるチームにとって実用的なオプションです。その小さなランタイムとローカル処理は外部依存関係を減少させますが、ユーザーは視覚入力が異なるため、自分のUIテーマや撮影したドキュメントに対して認識結果を検証する必要があります。このツールは、プライバシーを優先し、Appleハードウェアおよびエージェントクライアントとの緊密な統合を重視するプロジェクトに最適です。





