LESSON 02 · CODE 代码操作

AI 能操控你的电脑

Code & 操作本地 · 第 2 课

Why this lesson · 为什么值得学

学完这一课,你能

学会让 AI 直接操控电脑和软件

用「操作窗口」自动点按、填表、整理

把重复的电脑操作交给 AI 干

核心洞察:「操作窗口」就是 AI 接管你的电脑屏幕——它用自己的「眼睛」看你的屏幕,用「手」(鼠标键盘)操作软件。你只需要告诉它「帮我做这个」,它自己去点、去搜、去填。

从「对话」到「动手」

上一课你学了 AI 可以替你写代码。但写代码还不够——如果 AI 能自己运行这些代码呢?

这就是「操作窗口」(Computer Use)要做的事。

— 想象这个场景

你对 AI 说:「帮我去这个网站查一下数据,整理到表格里,发邮件给老板。」

接下来 AI 会:

  1. 自动打开浏览器
  2. 输入网址
  3. 在页面上找数据
  4. 复制到表格里
  5. 打开邮箱,写邮件,发送

你全程只需要说一句话。AI 替你完成了所有操作。

操作窗口到底是什么?

简单说,操作窗口是 AI 的「眼睛」和「手」

AI 的「器官」对应什么具体表现
眼睛 屏幕截图 AI 每隔几秒拍一张屏幕照片,分析上面有什么
鼠标点击 AI 计算坐标,移动到按钮位置,点击
手指 键盘输入 AI 在输入框里打字、按回车、用快捷键

听起来很科幻?但这就是 2026 年主流 AI 工具已经具备的能力。你用的 ChatGPT、Claude、Hermes 等,大部分都有「操作电脑」的功能。

它和前面学的能力有什么区别?

只有 Chat 窗口

你:「帮我查一下下周末上海有什么展览」

AI:「我建议你去某网站搜索……」

AI 只能给你建议——你要自己去搜。

有操作窗口

你:「帮我查一下下周末上海有什么展览」

AI 自动打开浏览器 → 搜索「上海 周末 展览」→ 浏览结果 → 整理成表格给你看。

AI 替你做了全部操作——你只需要等结果。

操作窗口能做什么?

实际场景中,操作窗口最常用的功能:

网页操作

打开浏览器 → 搜索 → 填表单 → 下载文件 → 截图保存

文件管理

创建文件夹 → 移动文件 → 重命名 → 批量整理桌面

编辑文档

打开 Word/Excel → 填入数据 → 调格式 → 导出 PDF

运行程序

打开终端 → 运行你让它写的脚本 → 查看运行结果 → 修复错误

操作窗口的限制(你也要知道)

操作窗口很强大,但不是万能的。了解限制,你才能知道什么时候用它、什么时候不用:

限制说明
速度慢AI 看屏幕→思考→点击→再看,比人手动操作慢 2-5 倍
容易「看错」AI 用「眼睛」看屏幕,可能会把两个相似按钮认错
需要你的授权每次操作前通常需要你允许——不是想点就点的
不太适合纯视觉操作比如抠图、调颜色、设计排版——这些还是你亲手做更好
不擅长需要「审美判断」的事做 PPT 选哪个模板好看?这种事让 AI 自己选可能不满意

实用建议:操作窗口最适合「有明确步骤的重复性工作」——比如填 50 个表单、批量下载文件、整理文件夹。不适合需要审美或判断力的工作。

Code + 操作窗口 = 真正的自动化

把第1课和第2课的能力合在一起,你就有了一个真正的 AI 助手

— 举个完整的例子

你想每天自动监控某个商品的价格变化:

  1. Code 能力 → 你让 AI 写一个价格监控脚本
  2. 操作窗口 → 你让 AI 打开浏览器,配置这个脚本每天早上 8 点自动运行
  3. 结果 → 每天早上你会收到一条消息:「你关注的商品今天降了 50 元」

Code 帮你做了工具,操作窗口帮你部署和设置。两件事加起来,AI 才算真的帮你完成了「一整件事」。

高手心法 · 读懂再跑

AI 给的代码,先看明白再运行

当 AI 写了一段代码、或准备替你跑脚本,先花一分钟看明白它要做什么,再点运行。Anthropic 的《Claude Code Best Practices》提醒得很直白:AI 写出来的每一行,最终都是你负责——它会很自信地改你的构建配置,也可能用错框架版本、偷偷加新依赖、漏掉错误处理。

「它看起来对」不等于「它真能用」——你才是最后那道关。

安全红线 · 护好钥匙

密码、API Key 永远别粘进对话

让 AI 连某个服务时,别把账号密码、API Key 直接贴进聊天框。Anthropic 的《API 密钥最佳实践》明确:密钥要放进环境变量或密钥管理系统(如 .env 且务必加入 .gitignore),而不是写进对话或代码里。

原因很实在——一旦粘进聊天,密钥就以明文留在你的对话记录里,想撤回都撤不回。需要授权时,让 AI 从本地的密钥文件读,而不是直接把钥匙交到它「手上」。

你现在就能试的操作

如果你用的是支持操作窗口的 AI 工具(查一下你用的 AI 支不支持「Computer Use」或「操作电脑」),可以试这个:

试一下

  1. 打开你的 AI 工具
  2. 告诉它:「帮我打开浏览器,搜索『今天的热门新闻』,把前 5 条整理成列表给我。」
  3. 看它的反应——有些会直接操作你的电脑屏幕,有些会说「我没有这个权限」

如果它说没有权限,也不用失望——知道有这个能力就够了。未来大多数 AI 都会支持。

自我检查

检查你的理解

  1. 操作窗口让 AI 多了哪两种「器官」?
  2. 操作窗口最适合做什么类型的事?不适合做什么?
  3. Code 和操作窗口分别解决什么问题?合在一起能做什么?

操作窗口 = AI 的「眼睛」+「手」。

你说需求,它自己去点鼠标、敲键盘。

REFERENCES · 参考资料

本课参考资料

  1. Anthropic《Claude Code Best Practices》、krowdev《Reviewing AI-Generated Code》
  2. Anthropic《API 密钥最佳实践》、Dave Swift《Claude Code Credentials Safety》
← 上一课 下一课:串联所有能力 →

有疑问?返回 主页,或者在 AI 聊天工具里搜「Computer Use」看你的工具是否支持。