爱看AI
返回列表
最新资讯国内industry

今天,Gemini全面杀入AI办公大战!

来源智东西(zhidx.com)前天 · 2026/10/9
今天,Gemini全面杀入AI办公大战!

智东西

作者 | 陈骏达

编辑 | 云鹏

智东西10月9日报道,今天凌晨,在Gemini at Work 2026大会上,谷歌云正式推出 企业通用智能体Gemini Agent ,试图将原本分散在办公软件、数据平台和开发工具中的任务,交给一个能够自主规划、调用工具并持续执行的智能体。

Gemini Agent的能力不再局限于回答问题或生成一段文本。用户可以直接用自然语言描述最终目标,让智能体 自行拆解任务、调用企业数据、编写和运行代码、生成文档与多媒体内容 ,并在云端持续推进复杂工作。

面对大型任务,它还能够组织多个子智能体协同执行,甚至以拥有独立企业身份的数字同事参与团队协作。

以准备PPT材料为例,用户可以直接要求Gemini Agent制作PPT、搭建收入预测模型,并生成配套宣传视频。智能体需要自行理解目标,调用相应的技能、企业数据和生成模型,完成各个环节,再将结果交付给用户。

在这一过程中,用户仍然可以检查进度、调整要求并决定是否授权关键操作,但不必一直守在电脑前,逐步指导每个执行步骤。

为了让智能体进入企业日常工作,谷歌云还围绕Gemini Agent补齐了 四重记忆机制、跨平台协作、企业数据访问、安全隔离和成本控制 等能力,形成一套能够将企业任务从指令推进到执行结果的智能体系统。

Gemini Agent的这一产品形态让人联想到国内的豆包工作、腾讯WorkBuddy和阿里的千问办公等产品,同样是办公智能体平台,同样主打“自主拆解任务、调用工具、持续推进工作”。

不过,需要注意的是,Gemini Agent是一款企业级产品,目前尚未公布具体的正式商用日期与定价方案,仅面向部分企业用户开放预览。

一、从对话到执行,Gemini Agent要做企业的通用同事

过去,企业中的AI能力通常分散在不同产品中:有人使用聊天机器人撰写文案,有人借助编程助手处理数据,还有人通过办公软件中的AI功能制作演示文稿。

Gemini Agent希望把这些能力整合到统一的智能体中,让同一智能体能够处理知识问答、文档生成、代码执行和多媒体创作等不同任务。

在使用入口上,谷歌云其延伸至Web、移动端、桌面端和命令行等环境,并推动智能体与Google Workspace、Microsoft 365、Slack等工作工具协同,还可以通过MCP接入其他服务。用户可以在日常工作环境中调用智能体,而不必每次都从头交代背景。

Gemini Agent还面向金融服务和法律行业提供专业化的版本,能更好地完成相关领域的任务。

长跨度任务是Gemini Agent试图突破的另一道门槛。

普通聊天机器人通常围绕当前对话工作,一旦任务涉及多个系统、较长执行时间或反复验证,就需要用户不断跟进。Gemini Agent则依托云端运行环境维持任务状态,使部分复杂工作能够在用户离开电脑后继续推进。

例如,数据分析任务可以经历数据提取、代码生成、模型训练、结果检查和报告整理等多个阶段。智能体不必在每一步完成后都等待用户重新下达指令,而是可以按照既定目标继续执行,并在遇到需要判断或授权的环节时寻求用户介入。

谷歌云还为Gemini Agent引入动态多智能体协同机制。当任务规模较大时,系统可以将工作拆分给多个子智能体,分别处理数据、代码或内容生成等环节,再汇总执行结果。

除了由员工主动发起任务,谷歌云还提出了数字同事(Coworker Agent)的概念。

这类智能体可以拥有独立的企业邮箱、专属存储空间和公司目录身份,并参与邮件与文档协作。借助相应的授权机制,它能够以团队成员的工作身份承担持续性任务,而不只是等待员工打开聊天窗口后才开始工作。

例如,企业可以将某些周期性的资料整理、信息汇总或邮件准备工作交给智能体,让它按照既定规则持续推进。

二、四重记忆让智能体理解企业,支持Gemini、Claude等模型

要让一个智能体长期参与企业工作,仅能理解当前指令还不够。它还需要记住用户正在处理什么任务、企业内部如何定义业务指标,以及过去的工作流程通常怎样执行。围绕这一问题,谷歌云提出了四类记忆机制,并将模型选择与具体任务进一步解耦。

四类记忆分别解决不同问题:

第一类是会话记忆(Session Memory),用于保留当前任务或对话的上下文,避免用户反复解释同一件事。

第二类是语义记忆(Semantic Memory),用于组织企业知识和业务概念,帮助智能体理解公司内部的术语、数据定义与知识关系。

第三类是程序记忆(Procedural Memory),用于沉淀工作流程和执行方法,让智能体能够复用经过定义的任务步骤。

第四类是情节记忆(Episodic Memory),用于记录与过去任务有关的经历和结果,为后续工作提供参考。

这四类记忆并非简单地把所有历史对话存进一个更大的上下文窗口,而是尝试区分不同类型的信息,让智能体在需要时调用相应背景。

例如,当员工要求生成一份销售分析报告时,智能体不仅需要理解本次指令,还需要知道公司对销售额、利润率等指标的定义,了解报告应采用的格式,并参考相关历史任务中的执行经验。

对企业而言,这类能力的价值在于减少重复交代背景的成本。不过,记忆能否准确、持续地发挥作用,仍取决于企业知识质量、权限设置和信息更新机制。

在模型层面,谷歌云则希望避免企业智能体被某一个模型完全绑定。

Gemini Agent支持在谷歌自有模型以及Anthropic Claude等第三方模型之间进行选择,并通过智能路由将不同任务分配给适合的模型。相对简单的工作可以交由成本更低的模型处理,复杂推理任务则可以调用更强的模型。

谷歌云称,采用智能路由后,相关任务的综合运行成本可以降至全部使用前沿模型时的1/3,执行速度提升40%。

在底层模型方面,谷歌也提到了上周发布的Gemini 4 Argon。该模型面向复杂推理和长跨度软件工程任务,在相关基准测试及谷歌内部工程应用中取得进展,为智能体执行复杂工作提供模型能力支撑。

三、企业数据不再只是存储资产,谷歌云补齐智能体的数据底座

影响智能体能否投入生产环境的,还有它能否准确调用数据、持续执行流程,并在整个过程中遵守企业规则。

谷歌云为Gemini Agent打造了多个面向具体场景的Skill。运营报告Skill可以让用户通过简单的对话了解企业运营数据,机器学习Skill则可以在AI开发场景中发挥作用。

智能体需要自主执行任务,就必须能够理解和使用企业数据。然而,大量企业信息仍然散落在数据库、云存储、办公文档和业务系统中。即使模型本身足够强大,如果无法理解数据含义或获得适当访问权限,也很难完成端到端的业务任务。

谷歌云此次为Gemini Agent整合了Knowledge Catalog、Smart Storage和Borderless Lakehouse等能力,试图降低智能体使用企业数据的门槛。

Knowledge Catalog的重点,是帮助智能体理解数据背后的业务语义。

企业中的同一个指标,可能在不同系统中采用不同字段名称或计算方式。例如,员工提出查询“净利润率”,智能体不仅需要找到相关数据,还需要知道企业对这一指标的具体定义,以及相应的数据来自哪里。

通过Knowledge Catalog,谷歌云希望将业务概念与底层数据结构关联起来,并兼容Databricks、dbt、Looker建模体系及SAP等企业数据环境。这样,智能体在执行分析任务时,就能依据企业已有的业务定义定位数据,而不是完全依赖字段名称猜测含义。

在大会演示中,数据科学智能体根据自然语言指令提取数据、生成代码并训练XGBoost模型,展示了从业务问题到机器学习分析结果的自动化流程。

Smart Storage则将AI能力延伸至非结构化文件。图像、PDF和扫描文档通常缺少可直接用于检索的结构化信息,企业即使保存了大量资料,也不一定能快速找到真正有用的内容。

谷歌云希望借助Gemini对这些文件进行上下文理解与标注,让智能体能够从存储中的资料提取相关信息。

例如,Snap将Prism智能体与存储归档连接,用于技术诊断和故障排查。谷歌云披露,该方案将相关排查时间从30分钟缩短至30秒。日立则利用HMAX智能体比对生产现场工序前后的接线照片,帮助一线人员识别差异,获得30%的生产力提升。

另一项能力Borderless Lakehouse,针对的是企业跨云数据分散的问题。谷歌云希望在不要求企业统一搬迁数据的情况下,联合查询Amazon S3、Azure Data Lake、Salesforce和Workday等不同数据源,并减少跨云数据移动带来的成本与复杂性。

企业不必先将所有数据迁移到单一平台,再开始部署智能体,而是可以逐步让智能体访问现有数据资产。

四、智能体自主行动后,安全与成本成为关键

当AI从生成内容走向调用工具、运行代码和操作业务系统,企业面临的风险也随之变化。

一个只能回答问题的聊天机器人,通常不会直接修改生产系统;一个能够持续执行任务的智能体,却可能在获得权限后访问文件、调用接口、运行程序,甚至触发跨系统操作。

因此,谷歌云将身份管理、执行隔离、网络流量控制和成本管理纳入Gemini Agent的企业治理体系。

首先,每个智能体都可以拥有独立的身份与相应权限,其执行操作能够被记录并纳入审计,包括调用虚拟机运行代码等环节。这使企业有机会追踪智能体做过什么、访问了哪些资源,以及相关操作发生在何时。

其次,谷歌云还为Gemini Agent配备了Agent Sandbox和Agent Gateway。前者用于隔离智能体执行任务的环境,后者负责管理智能体进出系统的网络流量,并对恶意指令和不符合权限要求的数据访问进行拦截。

例如,企业可以针对特定文件设置访问限制,避免智能体因收到不当指令而读取无权访问的敏感资料。对于需要运行代码的任务,隔离执行环境也有助于降低不受控操作对其他系统的影响。

成本控制同样重要。智能体执行长跨度任务时,可能反复调用模型、工具和云端运行环境。如果没有预算约束,复杂任务很容易产生难以预估的费用。

谷歌云提供了项目级实时支出上限(Spend Caps),管理员可以设定预算阈值,并在触及上限后暂停相关任务,再根据情况恢复执行。结合模型智能路由,企业可以尝试在任务质量、响应速度与运行成本之间取得平衡。

结语: 谷歌云补齐拼图,但真正的考验才刚开始

谷歌云此次发布的Gemini Agent,补齐了他们在企业级智能体赛道的业务布局。此前,OpenAI和Anthropic等AI模型企业已经先行一步押注了企业级智能体赛道,并抢占了一定的用户心智。

要在这一竞争激烈的市场里拿下更多份额,谷歌云需要证明Gemini Agent能在权限治理、跨系统集成、成本透明度等企业用户关心的场景, 做出 经得起生产环境检验的答案,而不只是发布会上的演示。

资讯由采集器定时从公开的机器人 / AI 信息源自动聚合。

相关内容

国外industry自动翻译

为什么灵活性是物理人工智能的真正瓶颈

机器人灵活性的下一个主要挑战是使整个系统足够可靠,以将功能转化为有用的工作。 《为什么灵活性是物理人工智能的真正瓶颈》一文首先出现在《机器人报告》上。

来源Robotics Business Review6小时前
国内industry

Agentic开发时代到来!鸿蒙PC三大原生开发工具公测,补齐国产操作系统生态关键短板

智东西 作者 | 程茜 编辑 | 漠影 当一台鸿蒙PC,既能跑鸿蒙应用,又能原生开发鸿蒙应用,会发生什么? 智东西10月10日报道,10月8日,可视化一站式IDE工具DevEco Studio、一站式鸿蒙应用AI开发工具DevEco Code与AI开发能力套件DevEco CLI,同步开启鸿蒙PC版公测。 三者分工明确:DevEco Studio主打集成开发、多端调试,承担基础IDE核心能力;DevEco Code提供端到端一站式Agentic开发体验;DevEco CLI对外输出鸿蒙开发能力,可无缝对接外部各类Agent工作流,让 AI 辅助开发融入鸿蒙 PC 原生环境。 DevEco三件套

来源智东西7小时前
国内industry

编程体验接近Opus 5.5?谷歌Gemini 4新版本曝光

智东西 编译 | 杨京丽 编辑 | 李水青 智东西10月10日消息,今日,据外媒Business Insider报道,谷歌正在 内部测试Gemini 4的一个新版本 ,代号为 Carbon ,有望进一步缩小其与竞争对手在编程能力上的差距。 目前,Carbon已接入谷歌内部编程平台Jetski。部分员工认为,该模型的编程体验 与Claude Opus 5.5近似 ,但有员工强调,模型实际需要进行更多测试,才能作出更准确的判断。 谷歌已于10月1日发布Gemini 4 Argon ,重点面向 软件工程、企业知识工作、网络安全防御等场景 ,目前该模型尚未面向公众推出。 Carbon可能是Argon训

来源智东西7小时前
国内industry

2026中国计算机大会定了,12位院士演讲,腾讯阿里百度、小米京东都来了

智东西 作者 | 王涵 编辑 | 云鹏 智东西10月10日报道,今天,第二十三届中国计算机大会(CNCC2026)新闻发布会在京举行,智东西等媒体受邀参加。 据介绍,CNCC2026将于 10月21日至24日 在四川成都举办,主会场设于中国西部国际博览城和天府国际会议中心,大会主题为 “数聚驱动,智算未来” 。 本届大会共设 17场特邀报告、3场大会论坛、167个专题论坛及40余场专题活动 ,同期还将举办CCF计算机展览会。 其中,专题论坛演讲者有 789位 , 院士级演讲者有12位 ,来自腾讯、阿里、百度、小米、京东等企业专家达 92位 。 专题论坛围绕 11大主题 领域展开,包括:AI基础

来源智东西11小时前
国内industry

00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本

智东西 作者 | 杨京丽 编辑 | 李水青 智东西10月10日报道,一项来自麻省理工学院(MIT)等机构的研究发现, 只要固定基础模型回答开头的两个Token,就能让模型的数学推理成绩接近对应的强化学习版本 。 以艾伦人工智能研究所(Ai2)的基础模型Olmo-3-7B为例, 将回答固定为“.\n\nOkay”开头 后,模型在MATH-500上的 准确率从42%升至78% , 超过其强化学习版本的75% 。 这个过程没有修改模型参数,也没有给模型增加新的解题示例。模型只是换了一个回答起点,原本没有稳定表现出来的解题能力,似乎就更容易被调用出来。 换句话说,基础模型答错题,有时不一定是完全不会做

来源智东西12小时前
国内industry

好产品就是与时代和生活共振|2026 年度极客最爱好物启动

一件好产品,往往是在用过一段时间之后,才让人意识到它的好。出门时顺手带上,遇到事情时首先打开,或者因为有了它,愿意尝试一件过去觉得麻烦的事。这样的产品,值得被分享给更多人。 2026 年,我们把寻找好产品的目光,投向更丰富的形态。能协助完成任务的 AI 应用、戴在身上的智能设备,以及尝试在真实环境中干活的机器人,都进入了今年的选品视野。技术提供了新的可能,具体的产品体验,决定了人们愿不愿意把它们带进生活。 我们关注产品解决了什么问题,也在意使用它要付出多少学习和操作成本。一款创作工具,可以让想法更容易实现;一件有趣的小设备,也可以只负责让人开心。我们同样欢迎那些在设计、手感或某个小细节上做得出

来源极客公园12小时前