Computer Use の OSS である trycua/cua を触るようになってから、“CUA” という語をよく目にするようになりました。リポジトリ名にもパッケージ名にも入っているので、なんとなく Computer Use 関連の名前だと受け取ったまま、何の略かを確かめずに使っていました。
あらためて CUA の説明資料を探していたところ、OpenAI の発表ページ「Computer-Using Agent」にたどり着き、CUA は Computer-Using Agent の略だとようやく分かりました。同じように、略語の意味を知らないまま CUA という語を使っている人もいると思うので、確認したことを用語の整理としてまとめておきます。
CUA は Computer-Using Agent の略
OpenAI は 2025 年 1 月 23 日に、ユーザーの代わりに Web 上でタスクを実行するエージェント Operator の研究プレビューを発表しました。その Operator を動かすモデルとして同時に発表されたのが Computer-Using Agent(CUA)です(Computer-Using Agent)。
発表ページの説明を整理すると、CUA は次のようなモデルです。
- GPT-4o の視覚機能と、強化学習による推論を組み合わせている
- 画面上のボタン・メニュー・テキストフィールドといった GUI を、人間と同じように操作するよう学習している
- OS や Web サービス固有の API を使わずに、画面とマウス・キーボードという共通のインターフェースでタスクを実行する
つまり CUA は、もともとは OpenAI の特定のモデルを指す名前です。発表時点では、米国の ChatGPT Pro ユーザー向けに Operator を通じて提供され、開発者向けに API で公開する予定とも書かれていました。なお Operator は、2025 年 7 月 17 日に ChatGPT エージェントとして ChatGPT に統合されたと、Operator の発表ページに追記されています。
CUA の動き方:知覚・推論・アクションのループ
発表ページでは、CUA はユーザーの指示を受けたあと、知覚・推論・アクションを繰り返すループで動くと説明されています。
- 知覚:コンピュータのスクリーンショットをモデルのコンテキストに追加し、画面の現在の状態を把握する
- 推論:現在と過去のスクリーンショットやアクションを踏まえ、思考の連鎖(chain-of-thought)で次のステップを決める
- アクション:クリック・スクロール・タイピングなどを実行する。タスクが完了したと判断するか、ユーザーの入力が必要になるまで続ける
ログイン情報の入力や CAPTCHA への回答のような操作では、ユーザーに確認を求めるとも書かれています。
flowchart LR U["ユーザーの指示"] --> P["知覚<br/>スクリーンショットを取得"] P --> R["推論<br/>次のステップを決める"] R --> A["アクション<br/>クリック・スクロール・入力"] A -->|"画面が変わる"| P R -->|"完了、または確認が必要"| E["ユーザーへ返す"]
API を経由せずに画面のピクセルを見て操作するので、専用の API がないアプリや Web サイトにも同じ方法で対応できます。
発表時点のベンチマーク
発表ページには、次のベンチマーク結果が載っています。数値は 2025 年 1 月の発表時点のものです。
| ベンチマーク | 対象 | CUA | 以前の SOTA(同じ汎用インターフェース) | 以前の SOTA(Web ブラウジングエージェント) | 人間 |
|---|---|---|---|---|---|
| OSWorld | Ubuntu・Windows・macOS などの OS 全体の操作 | 38.1% | 22.0% | - | 72.4% |
| WebArena | セルフホストした Web サイトでのタスク | 58.1% | 36.2% | 57.1% | 78.2% |
| WebVoyager | Amazon・GitHub・Google マップなど実在のサイトでのタスク | 87.0% | 56.0% | 87.0% | - |
OSWorld では人間の 72.4% に対して 38.1% で、OS 全体を操作するタスクにはまだ差があることも、発表ページ自身が認めています。
近い用語との使い分け
CUA の意味が分かると、周辺の用語も区別しやすくなります。この記事では次のように整理しています。
| 用語 | 指しているもの | 例 |
|---|---|---|
| CUA(Computer-Using Agent) | OpenAI が発表した、GUI を操作するモデルの名前 | Operator を動かすモデル |
| Computer Use | モデルが画面を見てマウス・キーボードで操作する機能やツールの名前 | Anthropic の computer use、OpenAI API の Computer use |
| computer-use agent | 画面を操作してタスクをこなすエージェント全般を指す一般名詞 | OSS のエージェントやフレームワーク全般 |
Computer Use は、Anthropic が 2024 年 10 月に Claude 3.5 Sonnet とあわせて発表した機能名でもあります。OpenAI の発表ページも参考文献にこの発表を挙げています。
OpenAI 側でも、現在の API ドキュメントでは機能名として “Computer use” が使われています。一方で、ドキュメントからリンクされているサンプルアプリのリポジトリ名は openai/openai-cua-sample-app で、説明文には “CUA (our Computer Using Agent)” とあり、CUA という呼び名も残っています。
trycua/cua のほうは、たとえば libs/python/som の README で自分たちのフレームワークを “Computer-Use Agent (Cua)” と書いています(libs/python/som/README.md)。OpenAI の “Computer-Using Agent” とは 1 語違いで、略すとどちらも CUA になります。trycua の blog 記事 A Story of Computer-Use では、OpenAI の Operator を “powered by their Computer-Using Agent (CUA) model” と紹介しているので、trycua 自身も CUA を OpenAI のモデル名として書き分けていることが分かります。
名前が同じでも、実装が同じとは限らない
略語が同じ CUA でも、OpenAI のモデル名としての CUA と、trycua/cua というプロジェクト名の Cua は、それぞれ別の組織が付けた名前です。名前の一致だけでは、同じ技術や同じ実装を使っているかは判断できません。
この点は、続編の記事「Codex に Mac を操作させたら “cua” が出てきた — ChatGPT.app 同梱の cua_repl と OSS の cua-driver を調べて分かったこと」で確かめています。Codex の Computer Use が呼んでいた mcp__cua_repl を ChatGPT.app の同梱ファイルからたどり、trycua の cua-driver との関係を調べました。
以上、trycua/cua で目にしていた CUA が OpenAI の Computer-Using Agent の略だと知り、Computer Use・computer-use agent との違いを整理した、現場からお送りしました。
参考情報
- Computer-Using Agent | OpenAI
- Operator が登場 | OpenAI
- Computer use | OpenAI API
- openai/openai-cua-sample-app
- Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku | Anthropic
- コンピューター使用ツール | Claude Docs
- trycua/cua
- Codex に Mac を操作させたら “cua” が出てきた — ChatGPT.app 同梱の cua_repl と OSS の cua-driver を調べて分かったこと