今天,Gemini全面杀入AI办公大战!

智东西
作者 | 陈骏达
编辑 | 云鹏
智东西10月9日报道,今天凌晨,在Gemini at Work 2026大会上,谷歌云正式推出 企业通用智能体Gemini Agent ,试图将原本分散在办公软件、数据平台和开发工具中的任务,交给一个能够自主规划、调用工具并持续执行的智能体。
Gemini Agent的能力不再局限于回答问题或生成一段文本。用户可以直接用自然语言描述最终目标,让智能体 自行拆解任务、调用企业数据、编写和运行代码、生成文档与多媒体内容 ,并在云端持续推进复杂工作。
面对大型任务,它还能够组织多个子智能体协同执行,甚至以拥有独立企业身份的数字同事参与团队协作。
以准备PPT材料为例,用户可以直接要求Gemini Agent制作PPT、搭建收入预测模型,并生成配套宣传视频。智能体需要自行理解目标,调用相应的技能、企业数据和生成模型,完成各个环节,再将结果交付给用户。
在这一过程中,用户仍然可以检查进度、调整要求并决定是否授权关键操作,但不必一直守在电脑前,逐步指导每个执行步骤。
为了让智能体进入企业日常工作,谷歌云还围绕Gemini Agent补齐了 四重记忆机制、跨平台协作、企业数据访问、安全隔离和成本控制 等能力,形成一套能够将企业任务从指令推进到执行结果的智能体系统。
Gemini Agent的这一产品形态让人联想到国内的豆包工作、腾讯WorkBuddy和阿里的千问办公等产品,同样是办公智能体平台,同样主打“自主拆解任务、调用工具、持续推进工作”。
不过,需要注意的是,Gemini Agent是一款企业级产品,目前尚未公布具体的正式商用日期与定价方案,仅面向部分企业用户开放预览。
一、从对话到执行,Gemini Agent要做企业的通用同事
过去,企业中的AI能力通常分散在不同产品中:有人使用聊天机器人撰写文案,有人借助编程助手处理数据,还有人通过办公软件中的AI功能制作演示文稿。
Gemini Agent希望把这些能力整合到统一的智能体中,让同一智能体能够处理知识问答、文档生成、代码执行和多媒体创作等不同任务。
在使用入口上,谷歌云其延伸至Web、移动端、桌面端和命令行等环境,并推动智能体与Google Workspace、Microsoft 365、Slack等工作工具协同,还可以通过MCP接入其他服务。用户可以在日常工作环境中调用智能体,而不必每次都从头交代背景。
Gemini Agent还面向金融服务和法律行业提供专业化的版本,能更好地完成相关领域的任务。
长跨度任务是Gemini Agent试图突破的另一道门槛。
普通聊天机器人通常围绕当前对话工作,一旦任务涉及多个系统、较长执行时间或反复验证,就需要用户不断跟进。Gemini Agent则依托云端运行环境维持任务状态,使部分复杂工作能够在用户离开电脑后继续推进。
例如,数据分析任务可以经历数据提取、代码生成、模型训练、结果检查和报告整理等多个阶段。智能体不必在每一步完成后都等待用户重新下达指令,而是可以按照既定目标继续执行,并在遇到需要判断或授权的环节时寻求用户介入。
谷歌云还为Gemini Agent引入动态多智能体协同机制。当任务规模较大时,系统可以将工作拆分给多个子智能体,分别处理数据、代码或内容生成等环节,再汇总执行结果。
除了由员工主动发起任务,谷歌云还提出了数字同事(Coworker Agent)的概念。
这类智能体可以拥有独立的企业邮箱、专属存储空间和公司目录身份,并参与邮件与文档协作。借助相应的授权机制,它能够以团队成员的工作身份承担持续性任务,而不只是等待员工打开聊天窗口后才开始工作。
例如,企业可以将某些周期性的资料整理、信息汇总或邮件准备工作交给智能体,让它按照既定规则持续推进。
二、四重记忆让智能体理解企业,支持Gemini、Claude等模型
要让一个智能体长期参与企业工作,仅能理解当前指令还不够。它还需要记住用户正在处理什么任务、企业内部如何定义业务指标,以及过去的工作流程通常怎样执行。围绕这一问题,谷歌云提出了四类记忆机制,并将模型选择与具体任务进一步解耦。
四类记忆分别解决不同问题:
第一类是会话记忆(Session Memory),用于保留当前任务或对话的上下文,避免用户反复解释同一件事。
第二类是语义记忆(Semantic Memory),用于组织企业知识和业务概念,帮助智能体理解公司内部的术语、数据定义与知识关系。
第三类是程序记忆(Procedural Memory),用于沉淀工作流程和执行方法,让智能体能够复用经过定义的任务步骤。
第四类是情节记忆(Episodic Memory),用于记录与过去任务有关的经历和结果,为后续工作提供参考。
这四类记忆并非简单地把所有历史对话存进一个更大的上下文窗口,而是尝试区分不同类型的信息,让智能体在需要时调用相应背景。
例如,当员工要求生成一份销售分析报告时,智能体不仅需要理解本次指令,还需要知道公司对销售额、利润率等指标的定义,了解报告应采用的格式,并参考相关历史任务中的执行经验。
对企业而言,这类能力的价值在于减少重复交代背景的成本。不过,记忆能否准确、持续地发挥作用,仍取决于企业知识质量、权限设置和信息更新机制。
在模型层面,谷歌云则希望避免企业智能体被某一个模型完全绑定。
Gemini Agent支持在谷歌自有模型以及Anthropic Claude等第三方模型之间进行选择,并通过智能路由将不同任务分配给适合的模型。相对简单的工作可以交由成本更低的模型处理,复杂推理任务则可以调用更强的模型。
谷歌云称,采用智能路由后,相关任务的综合运行成本可以降至全部使用前沿模型时的1/3,执行速度提升40%。
在底层模型方面,谷歌也提到了上周发布的Gemini 4 Argon。该模型面向复杂推理和长跨度软件工程任务,在相关基准测试及谷歌内部工程应用中取得进展,为智能体执行复杂工作提供模型能力支撑。
三、企业数据不再只是存储资产,谷歌云补齐智能体的数据底座
影响智能体能否投入生产环境的,还有它能否准确调用数据、持续执行流程,并在整个过程中遵守企业规则。
谷歌云为Gemini Agent打造了多个面向具体场景的Skill。运营报告Skill可以让用户通过简单的对话了解企业运营数据,机器学习Skill则可以在AI开发场景中发挥作用。
智能体需要自主执行任务,就必须能够理解和使用企业数据。然而,大量企业信息仍然散落在数据库、云存储、办公文档和业务系统中。即使模型本身足够强大,如果无法理解数据含义或获得适当访问权限,也很难完成端到端的业务任务。
谷歌云此次为Gemini Agent整合了Knowledge Catalog、Smart Storage和Borderless Lakehouse等能力,试图降低智能体使用企业数据的门槛。
Knowledge Catalog的重点,是帮助智能体理解数据背后的业务语义。
企业中的同一个指标,可能在不同系统中采用不同字段名称或计算方式。例如,员工提出查询“净利润率”,智能体不仅需要找到相关数据,还需要知道企业对这一指标的具体定义,以及相应的数据来自哪里。
通过Knowledge Catalog,谷歌云希望将业务概念与底层数据结构关联起来,并兼容Databricks、dbt、Looker建模体系及SAP等企业数据环境。这样,智能体在执行分析任务时,就能依据企业已有的业务定义定位数据,而不是完全依赖字段名称猜测含义。
在大会演示中,数据科学智能体根据自然语言指令提取数据、生成代码并训练XGBoost模型,展示了从业务问题到机器学习分析结果的自动化流程。
Smart Storage则将AI能力延伸至非结构化文件。图像、PDF和扫描文档通常缺少可直接用于检索的结构化信息,企业即使保存了大量资料,也不一定能快速找到真正有用的内容。
谷歌云希望借助Gemini对这些文件进行上下文理解与标注,让智能体能够从存储中的资料提取相关信息。
例如,Snap将Prism智能体与存储归档连接,用于技术诊断和故障排查。谷歌云披露,该方案将相关排查时间从30分钟缩短至30秒。日立则利用HMAX智能体比对生产现场工序前后的接线照片,帮助一线人员识别差异,获得30%的生产力提升。
另一项能力Borderless Lakehouse,针对的是企业跨云数据分散的问题。谷歌云希望在不要求企业统一搬迁数据的情况下,联合查询Amazon S3、Azure Data Lake、Salesforce和Workday等不同数据源,并减少跨云数据移动带来的成本与复杂性。
企业不必先将所有数据迁移到单一平台,再开始部署智能体,而是可以逐步让智能体访问现有数据资产。
四、智能体自主行动后,安全与成本成为关键
当AI从生成内容走向调用工具、运行代码和操作业务系统,企业面临的风险也随之变化。
一个只能回答问题的聊天机器人,通常不会直接修改生产系统;一个能够持续执行任务的智能体,却可能在获得权限后访问文件、调用接口、运行程序,甚至触发跨系统操作。
因此,谷歌云将身份管理、执行隔离、网络流量控制和成本管理纳入Gemini Agent的企业治理体系。
首先,每个智能体都可以拥有独立的身份与相应权限,其执行操作能够被记录并纳入审计,包括调用虚拟机运行代码等环节。这使企业有机会追踪智能体做过什么、访问了哪些资源,以及相关操作发生在何时。
其次,谷歌云还为Gemini Agent配备了Agent Sandbox和Agent Gateway。前者用于隔离智能体执行任务的环境,后者负责管理智能体进出系统的网络流量,并对恶意指令和不符合权限要求的数据访问进行拦截。
例如,企业可以针对特定文件设置访问限制,避免智能体因收到不当指令而读取无权访问的敏感资料。对于需要运行代码的任务,隔离执行环境也有助于降低不受控操作对其他系统的影响。
成本控制同样重要。智能体执行长跨度任务时,可能反复调用模型、工具和云端运行环境。如果没有预算约束,复杂任务很容易产生难以预估的费用。
谷歌云提供了项目级实时支出上限(Spend Caps),管理员可以设定预算阈值,并在触及上限后暂停相关任务,再根据情况恢复执行。结合模型智能路由,企业可以尝试在任务质量、响应速度与运行成本之间取得平衡。
结语: 谷歌云补齐拼图,但真正的考验才刚开始
谷歌云此次发布的Gemini Agent,补齐了他们在企业级智能体赛道的业务布局。此前,OpenAI和Anthropic等AI模型企业已经先行一步押注了企业级智能体赛道,并抢占了一定的用户心智。
要在这一竞争激烈的市场里拿下更多份额,谷歌云需要证明Gemini Agent能在权限治理、跨系统集成、成本透明度等企业用户关心的场景, 做出 经得起生产环境检验的答案,而不只是发布会上的演示。
News is gathered automatically from public robotics & AI feeds on a schedule.
Related

Why dexterity is physical AI’s real bottleneck
The next major challenge in robotic dexterity is making the entire system reliable enough to turn capabilities into useful work. The post Why dexterity is physical AI’s real bottleneck appeared first on The Robot Report .

Agentic开发时代到来!鸿蒙PC三大原生开发工具公测,补齐国产操作系统生态关键短板
智东西 作者 | 程茜 编辑 | 漠影 当一台鸿蒙PC,既能跑鸿蒙应用,又能原生开发鸿蒙应用,会发生什么? 智东西10月10日报道,10月8日,可视化一站式IDE工具DevEco Studio、一站式鸿蒙应用AI开发工具DevEco Code与AI开发能力套件DevEco CLI,同步开启鸿蒙PC版公测。 三者分工明确:DevEco Studio主打集成开发、多端调试,承担基础IDE核心能力;DevEco Code提供端到端一站式Agentic开发体验;DevEco CLI对外输出鸿蒙开发能力,可无缝对接外部各类Agent工作流,让 AI 辅助开发融入鸿蒙 PC 原生环境。 DevEco三件套

编程体验接近Opus 5.5?谷歌Gemini 4新版本曝光
智东西 编译 | 杨京丽 编辑 | 李水青 智东西10月10日消息,今日,据外媒Business Insider报道,谷歌正在 内部测试Gemini 4的一个新版本 ,代号为 Carbon ,有望进一步缩小其与竞争对手在编程能力上的差距。 目前,Carbon已接入谷歌内部编程平台Jetski。部分员工认为,该模型的编程体验 与Claude Opus 5.5近似 ,但有员工强调,模型实际需要进行更多测试,才能作出更准确的判断。 谷歌已于10月1日发布Gemini 4 Argon ,重点面向 软件工程、企业知识工作、网络安全防御等场景 ,目前该模型尚未面向公众推出。 Carbon可能是Argon训

2026中国计算机大会定了,12位院士演讲,腾讯阿里百度、小米京东都来了
智东西 作者 | 王涵 编辑 | 云鹏 智东西10月10日报道,今天,第二十三届中国计算机大会(CNCC2026)新闻发布会在京举行,智东西等媒体受邀参加。 据介绍,CNCC2026将于 10月21日至24日 在四川成都举办,主会场设于中国西部国际博览城和天府国际会议中心,大会主题为 “数聚驱动,智算未来” 。 本届大会共设 17场特邀报告、3场大会论坛、167个专题论坛及40余场专题活动 ,同期还将举办CCF计算机展览会。 其中,专题论坛演讲者有 789位 , 院士级演讲者有12位 ,来自腾讯、阿里、百度、小米、京东等企业专家达 92位 。 专题论坛围绕 11大主题 领域展开,包括:AI基础

00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本
智东西 作者 | 杨京丽 编辑 | 李水青 智东西10月10日报道,一项来自麻省理工学院(MIT)等机构的研究发现, 只要固定基础模型回答开头的两个Token,就能让模型的数学推理成绩接近对应的强化学习版本 。 以艾伦人工智能研究所(Ai2)的基础模型Olmo-3-7B为例, 将回答固定为“.\n\nOkay”开头 后,模型在MATH-500上的 准确率从42%升至78% , 超过其强化学习版本的75% 。 这个过程没有修改模型参数,也没有给模型增加新的解题示例。模型只是换了一个回答起点,原本没有稳定表现出来的解题能力,似乎就更容易被调用出来。 换句话说,基础模型答错题,有时不一定是完全不会做

好产品就是与时代和生活共振|2026 年度极客最爱好物启动
一件好产品,往往是在用过一段时间之后,才让人意识到它的好。出门时顺手带上,遇到事情时首先打开,或者因为有了它,愿意尝试一件过去觉得麻烦的事。这样的产品,值得被分享给更多人。 2026 年,我们把寻找好产品的目光,投向更丰富的形态。能协助完成任务的 AI 应用、戴在身上的智能设备,以及尝试在真实环境中干活的机器人,都进入了今年的选品视野。技术提供了新的可能,具体的产品体验,决定了人们愿不愿意把它们带进生活。 我们关注产品解决了什么问题,也在意使用它要付出多少学习和操作成本。一款创作工具,可以让想法更容易实现;一件有趣的小设备,也可以只负责让人开心。我们同样欢迎那些在设计、手感或某个小细节上做得出