AIが画面を見て、マウスやキーボードでアプリを操作するComputer Use(Claudeの言葉なのかな?)。
しかしこれ、CodexCLIには相当のものがないんですよね。
普段使っているデスクトップはHyprland。 画面操作の仕組みを探していたら、hypruseという良さげなMCP実装があったので、ためしてみました。
画面を見せすぎないComputer Use
CodexAppのComputerUseの細かい仕様・実装って世にでてる?
うん、構成や動作仕様は出てる。ただ、内部実装を丸ごと読める状態までは確認できなかった。
面白いのは、公式のComputer Useも 「MCPサーバー+Skill」のプラグイン構成になっていること。専用の仕組みだけで完結しているわけではないんだね。公式ドキュメント
独自で作って、トークンの使用量エグい実装になっちゃったりしないかなぁ
なる可能性はある。でも、自作だから高くなるというより、「何を・何回モデルに見せるか」で差が出ると思う。
対象のウィンドウだけを撮る、決まった操作はまとめる、画面の変化を待つ間はモデルを呼ばない。こうした分担を考えながら、公式版は静止画ではなく動画を見続けているのか、という話になりました。調べた資料にはスクリーンショットの説明がありましたが、内部の取得間隔や差分処理までは分かりませんでした。
ストリーミング的な仕組みにしたら、エージェントが解釈する前段で操作の累計ができるから、なんかそういう最適化してるんじゃないかと訝しんだ。
カーソルの動く方向とか、描写切り替わり箇所の差分とかのコンテキストは機械的に取れるからさ いがいとそういう高度なことはしてない感じなんかね
あー、なるほど。動画を丸ごとモデルに送る話じゃなくて、ローカルで画面と操作を継続観測して、モデルに渡す情報を整理するってことね。
だから、本家についても「スクショと書いてある=そういう高度な前処理はしてない」とは言えない。公開資料では、その前段の最適化までわからないが正しい。
ふーーーむ…… まぁ、自作ComputerUseとまではいかなくとも、HyprlandCLIとかHyprlandMCPみたいなのは入ってたら良さそうな気がするね。
同じ考えをしてなんか作ってる人いないのかな?
いる! かなり今の話に近いものが見つかった。 特に hypruse が面白そう。
見つけたhypruseは、Hyprland上のウィンドウ情報、スクリーンショット、クリックやドラッグをMCP経由で扱うための道具です。操作を判断するAIではなく、エージェントが使う操作窓口にあたります。
特に、モデルに渡す前にローカルで複数回撮影して、最後の画像だけ返す部分は、まさにさっきの話。ただし変化した領域の意味を分析するものではなく、画像データの完全一致を見る素朴な方式。

