StateAct
長期的な computer-use agent を研究・開発する人向けに、ピクセルよりプログラム状態を優先する方法でデスクトップ/OS タスクのエージェント成果を作って評価する研究プロジェクトです。
ツール概要
現時点の証拠から見ると、StateAct は広く実証済みの完成ツールというより、注目すべき研究方向として評価するのが妥当です。利用可能な情報源のほとんどは X 上の論文紹介や著者側の発信であり、「注目を集めていること」「program state before pixels という中核アイデア」「OSWorld 2.0 での高成績の自己申告」は支持できますが、一般チームでの安定再現、導入容易性、運用コスト削減までを示すには不十分です。
実際の役割は、computer-use agent、GUI agent、デスクトップ自動化を研究する人に対して、スクリーンショット中心ではなく、取得可能なアプリ/システム状態を使って長期タスクを扱う設計視点を与えることにあります。したがって、これは汎用 RPA 製品ではなく、すぐ使えるブラウザ自動化フレームワークでもありません。より近い比喩は、GUI/OS エージェント向けの研究手法や評価上の主張であり、Zapier、UiPath、Playwright のような製品化ツールではなく、論文プロトタイプ寄りです。
コストや導入ハードルについては、証拠内に公式料金、API 価格、ホスティング、商用サポートの情報はありません。そのため保守的に言えるのは、採用コストの中心は SaaS 利用料よりも、論文再現、環境構築、データ整備、ベンチマーク実行にある可能性が高いということです。これは公式情報ではなく保守的推定です。論文を読み、評価環境を回せる研究寄りのチームには向きますが、すぐ業務導入したい、低摩擦で本番運用したいチームには証拠が足りません。
SNS 上の共通認識は今のところ前向きで、「ピクセルを増やすのではなくプログラム状態を見る」という逆張りの発想と、OSWorld 2.0 の成績主張に関心が集まっています。ただし議論の質は限定的です。evidenceSources はほぼ X の拡散、論文紹介、SOTA 告知が中心で、実機検証、詳しいチュートリアル、第三者再現、深い批判は少なく、熱度の証明は強い一方で、使いやすさや実運用性の証明は弱い状態です。現状では、導入定番というより追跡価値の高い研究トピックと言えます。