LESSON 02 · CODE 代码操作
Why this lesson · 为什么值得学
学会让 AI 直接操控电脑和软件
用「操作窗口」自动点按、填表、整理
把重复的电脑操作交给 AI 干
核心洞察:「操作窗口」就是 AI 接管你的电脑屏幕——它用自己的「眼睛」看你的屏幕,用「手」(鼠标键盘)操作软件。你只需要告诉它「帮我做这个」,它自己去点、去搜、去填。
上一课你学了 AI 可以替你写代码。但写代码还不够——如果 AI 能自己运行这些代码呢?
这就是「操作窗口」(Computer Use)要做的事。
— 想象这个场景
你对 AI 说:「帮我去这个网站查一下数据,整理到表格里,发邮件给老板。」
接下来 AI 会:
你全程只需要说一句话。AI 替你完成了所有操作。
简单说,操作窗口是 AI 的「眼睛」和「手」:
| AI 的「器官」 | 对应什么 | 具体表现 |
|---|---|---|
| 眼睛 | 屏幕截图 | AI 每隔几秒拍一张屏幕照片,分析上面有什么 |
| 手 | 鼠标点击 | AI 计算坐标,移动到按钮位置,点击 |
| 手指 | 键盘输入 | AI 在输入框里打字、按回车、用快捷键 |
听起来很科幻?但这就是 2026 年主流 AI 工具已经具备的能力。你用的 ChatGPT、Claude、Hermes 等,大部分都有「操作电脑」的功能。
你:「帮我查一下下周末上海有什么展览」
AI:「我建议你去某网站搜索……」
AI 只能给你建议——你要自己去搜。
你:「帮我查一下下周末上海有什么展览」
AI 自动打开浏览器 → 搜索「上海 周末 展览」→ 浏览结果 → 整理成表格给你看。
AI 替你做了全部操作——你只需要等结果。
实际场景中,操作窗口最常用的功能:
打开浏览器 → 搜索 → 填表单 → 下载文件 → 截图保存
创建文件夹 → 移动文件 → 重命名 → 批量整理桌面
打开 Word/Excel → 填入数据 → 调格式 → 导出 PDF
打开终端 → 运行你让它写的脚本 → 查看运行结果 → 修复错误
操作窗口很强大,但不是万能的。了解限制,你才能知道什么时候用它、什么时候不用:
| 限制 | 说明 |
|---|---|
| 速度慢 | AI 看屏幕→思考→点击→再看,比人手动操作慢 2-5 倍 |
| 容易「看错」 | AI 用「眼睛」看屏幕,可能会把两个相似按钮认错 |
| 需要你的授权 | 每次操作前通常需要你允许——不是想点就点的 |
| 不太适合纯视觉操作 | 比如抠图、调颜色、设计排版——这些还是你亲手做更好 |
| 不擅长需要「审美判断」的事 | 做 PPT 选哪个模板好看?这种事让 AI 自己选可能不满意 |
实用建议:操作窗口最适合「有明确步骤的重复性工作」——比如填 50 个表单、批量下载文件、整理文件夹。不适合需要审美或判断力的工作。
把第1课和第2课的能力合在一起,你就有了一个真正的 AI 助手:
— 举个完整的例子
你想每天自动监控某个商品的价格变化:
Code 帮你做了工具,操作窗口帮你部署和设置。两件事加起来,AI 才算真的帮你完成了「一整件事」。
AI 给的代码,先看明白再运行
当 AI 写了一段代码、或准备替你跑脚本,先花一分钟看明白它要做什么,再点运行。Anthropic 的《Claude Code Best Practices》提醒得很直白:AI 写出来的每一行,最终都是你负责——它会很自信地改你的构建配置,也可能用错框架版本、偷偷加新依赖、漏掉错误处理。
「它看起来对」不等于「它真能用」——你才是最后那道关。
密码、API Key 永远别粘进对话
让 AI 连某个服务时,别把账号密码、API Key 直接贴进聊天框。Anthropic 的《API 密钥最佳实践》明确:密钥要放进环境变量或密钥管理系统(如 .env 且务必加入 .gitignore),而不是写进对话或代码里。
原因很实在——一旦粘进聊天,密钥就以明文留在你的对话记录里,想撤回都撤不回。需要授权时,让 AI 从本地的密钥文件读,而不是直接把钥匙交到它「手上」。
如果你用的是支持操作窗口的 AI 工具(查一下你用的 AI 支不支持「Computer Use」或「操作电脑」),可以试这个:
如果它说没有权限,也不用失望——知道有这个能力就够了。未来大多数 AI 都会支持。
操作窗口 = AI 的「眼睛」+「手」。
你说需求,它自己去点鼠标、敲键盘。
REFERENCES · 参考资料
有疑问?返回 主页,或者在 AI 聊天工具里搜「Computer Use」看你的工具是否支持。