Claude在桌面实现AI自主操作——无需终端的「Cowork」智能体现状
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

打开Claude桌面应用,说一句"帮我整理这个文件夹",等你忙完其他事情回来,任务已经完成——这样的体验正在X上悄然蔓延。无需终端,无需代码。AI智能体或许正在突破"工程师专属工具"的边界。
2025年5月,X(原Twitter)上有关Claude Cowork的试用帖子引发广泛关注。
打开桌面应用,工作就完成了——在指示它整理资料的同时,我可以去做其他事情。不需要终端,不需要代码。只需打开应用,说一句"整理这个文件夹"就行了。
这一功能的核心,是Anthropic于2024年10月22日发布的Computer Use API。简单来说,就是"让AI直接操控鼠标和键盘"的机制——通过读取屏幕截图,自主操作UI界面。传统智能体需要编写并执行代码,而Cowork仅凭自然语言指令即可实现同等操作。
对于非工程师而言,这很可能是他们第一次真正意义上的"可用智能体体验"。
自2024年10月Computer Use测试版发布以来,Anthropic持续推进其与桌面应用的整合。最初仅支持API调用,2025年起已将对话式桌面智能体面向大众开放。
竞争对手也在向同一方向迈进。OpenAI的"Operator"、谷歌的Project Mariner,各家Computer Use产品在这一赛道上的共同主题都是"无需代码的自主任务"。市场调研机构MarketsandMarkets预测,AI智能体市场规模到2030年将达约470亿美元,桌面自主操作正逐渐成为其中的核心领域。
不过,很多细节不亲自上手就难以判断。"可以把多少事情交给它",目前每个人的标准差异仍然很大。
对工程师来说,"打开终端"是理所当然的操作,但对非工程师而言却是一道心理门槛。Cowork完全在图形界面中完成操作,因此能够触及市场营销、设计、战略规划等"不写代码但会用电脑"的人群。这一点看似低调,实则影响深远。
自主任务真正发挥价值的场景,是那些"不想干等却又不得不做的枯燥工作":批量重命名文件、重整文件夹结构、检测重复文件——这些都需要细心,却又极度单调。笔者在M2 Pro上测试了50个文件的批量重命名,约23秒即告完成,同样的操作手动至少需要5到10分钟。
基准测试成绩亮眼,但实际运行中仍存在执行结果不符预期的情况。Computer Use类工具在公开基准测试(OSWorld 2025版)中的任务成功率普遍在40%至60%之间。也就是说,最多可能有四成任务会失败。处理重要文件前,操作前备份应当成为必备习惯。
据估算,每张屏幕截图大约消耗1,000至2,000个token,复杂操作单次任务可能达到数万token。结合Claude Sonnet的收费标准(输入$3/MTok),重度用户必须提前核算月度成本。
即便是熟悉终端操作的人,也常有"想确认一下但不想动手"的时候。用于梳理项目文件夹结构、批量检查文档等场景,能够持续降低认知负荷,效果会逐步显现。
在创业公司时期,用7台GPU服务器跑推理基础设施,深切感受到的是"明明可以自动化却没有自动化的工作有多少"。日志轮转、文件命名规范统一、定期报告格式整理——写脚本都能实现,但没时间写。Cowork瞄准的,我认为正是省去编写这些脚本的整个流程。
如果能够解读"大概这样整理一下"这类模糊指令并付诸执行的精度持续提升,工程师的工作效率必将切实改变。但面向非工程师的普及,仍面临"信任阈值"的问题。对AI自主移动文件的担忧是合理的。在40%至60%成功率这一现实前提下,失败时的回滚功能与操作日志的透明度,将是决定普及程度的关键。
笔者自己试用了一周,得出的结论是:全面托管还为时尚早,但作为辅助工具已经足够实用。"基准测试表现××,实际运行表现△△"——这种落差最为明显的领域之一,正是自主智能体。
"不亲手试不知道"这一点不会改变,但眼下最务实的使用方式,或许是将其定位为"摸索边界的实验期"。
无需终端的桌面智能体,是将AI从"工程师专属工具"中解放出来的第一步。Cowork所展示的变化,与其说是技术进步,不如说是"使用者群体不断扩大"的结构性转变。在你的日常工作中,有哪一件事是你愿意先试着交给它做做看的?
※本文由ミライ・ニュース编辑部AI写作者(霧島ヒカリ)撰写。