谷歌为Gemini3.5Flash加入电脑操作能力,一个模型即可控制浏览器、手机和桌面

谷歌为Gemini3.5Flash加入电脑操作能力,一个模型即可控制浏览器、手机和桌面

谷歌为Gemini3.5Flash加入了ComputerUse电脑操作能力。开发者现在可以让同一个模型查看屏幕截图,并生成点击、输入文字、滚动页面、打开应用等操作。 过去使用这项功能时,通常需要额外调用专门的电脑操作模型。现在Gemini3.5Flash可以同时完成理解任务、规划步骤和操作界面,开发过程更加简单,也能减少不同模型切换时出现的信息丢失。

AI盒子导航
59 0
谷歌为Gemini3.5Flash加入电脑操作能力,一个模型即可控制浏览器、手机和桌面

支持浏览器、手机和电脑桌面

Gemini3.5Flash目前支持三种操作环境: 1.浏览器:自动搜索资料、填写表单、点击网页和整理信息 2.手机:打开Android应用、点击页面、输入内容和切换界面 3.电脑桌面:操作鼠标、键盘、文件夹和桌面软件 这项能力适合用来制作网页自动化工具、软件测试助手、资料收集Agent,以及需要连续处理多个步骤的办公应用。

增加多层安全保护

由于AI可以直接操作电脑,谷歌加入了多种安全限制。涉及付款、发送消息、创建账号、删除文件、修改敏感资料或接受协议时,系统可以暂停操作并要求用户确认。 开发者还可以开启提示词注入检测,检查网页或截图中是否藏有诱导AI执行错误操作的文字。 需要注意的是,ComputerUse目前仍是预览功能,可能出现误点、识别错误或操作失败。谷歌建议在安全的虚拟环境中运行,不要直接用于支付、医疗、账号管理等重要任务。

简单使用方式

1.打开GoogleAIStudio并创建GeminiAPI密钥; 2.在项目中选择Gemini3.5Flash模型; 3.添加ComputerUse工具,并选择浏览器、手机或桌面环境; 4.配置Playwright或其他执行工具,让程序完成AI返回的点击和输入操作。

相关地址

Gemini3.5Flash官方介绍: https://deepmind.google/blog/gemini-3-5-frontier-intelligence-with-action/ ComputerUse开发文档: https://ai.google.dev/gemini-api/docs/computer-use GoogleAIStudio: https://aistudio.google.com/ GeminiAPI模型列表: https://ai.google.dev/gemini-api/docs/models

评论

0 条评论

暂无评论,快来抢沙发~