谷歌为Gemini3.5Flash加入电脑操作能力,一个模型即可控制浏览器、手机和桌面
谷歌为Gemini3.5Flash加入了ComputerUse电脑操作能力。开发者现在可以让同一个模型查看屏幕截图,并生成点击、输入文字、滚动页面、打开应用等操作。 过去使用这项功能时,通常需要额外调用专门的电脑操作模型。现在Gemini3.5Flash可以同时完成理解任务、规划步骤和操作界面,开发过程更加简单,也能减少不同模型切换时出现的信息丢失。
支持浏览器、手机和电脑桌面
Gemini3.5Flash目前支持三种操作环境: 1.浏览器:自动搜索资料、填写表单、点击网页和整理信息 2.手机:打开Android应用、点击页面、输入内容和切换界面 3.电脑桌面:操作鼠标、键盘、文件夹和桌面软件 这项能力适合用来制作网页自动化工具、软件测试助手、资料收集Agent,以及需要连续处理多个步骤的办公应用。
增加多层安全保护
由于AI可以直接操作电脑,谷歌加入了多种安全限制。涉及付款、发送消息、创建账号、删除文件、修改敏感资料或接受协议时,系统可以暂停操作并要求用户确认。 开发者还可以开启提示词注入检测,检查网页或截图中是否藏有诱导AI执行错误操作的文字。 需要注意的是,ComputerUse目前仍是预览功能,可能出现误点、识别错误或操作失败。谷歌建议在安全的虚拟环境中运行,不要直接用于支付、医疗、账号管理等重要任务。
简单使用方式
1.打开GoogleAIStudio并创建GeminiAPI密钥; 2.在项目中选择Gemini3.5Flash模型; 3.添加ComputerUse工具,并选择浏览器、手机或桌面环境; 4.配置Playwright或其他执行工具,让程序完成AI返回的点击和输入操作。
相关地址
Gemini3.5Flash官方介绍: https://deepmind.google/blog/gemini-3-5-frontier-intelligence-with-action/ ComputerUse开发文档: https://ai.google.dev/gemini-api/docs/computer-use GoogleAIStudio: https://aistudio.google.com/ GeminiAPI模型列表: https://ai.google.dev/gemini-api/docs/models
评论
0 条评论暂无评论,快来抢沙发~