爱看AI
返回列表
最新资讯国内industry

Agent 时代来了,3D 生成大模型接下来比什么?

来源极客公园(geekpark.net)5天前 · 2026/9/24
Agent 时代来了,3D 生成大模型接下来比什么?

9 月 3 日,GPT-6 Astra 的发布,把 3D 内容创作带到了舞台中央。

在 GPT-6 Astra 官方发布页的一个不到 3 分钟的视频里与后续解读中,Astra 已经能直接进入 Blender,从一句住宅设计需求开始搭场景,先生成极简住宅,后来又将其扩展为围绕庭院展开的家庭住宅。里面有卧室、办公室、厨房和卫生间;家具从床板、衣柜挂杆、烤箱、餐具抽屉,再到灯光模拟,一应俱全。甚至水槽表面的法线出了问题之后,Astra 还会自己返工。

为了制作 30 秒室内漫游,它还会把相机放在约 1.65 米的人眼高度,用 24—26mm 镜头安排四段运动;进入 Unreal Engine 5 之后,它又自己处理 FBX、JSON、米和厘米的单位差、坐标转换、材质映射、碰撞和第一人称控制。

当通用模型也能做 3D 了,专业 3D 生成模型的价值会发生什么变化?

当下, 3D 工具的使用者,正逐渐从人 扩展 为 Agent。稳定的生成质量之外, 专业 3D 能力能否被 Agent 理解、调用,并用于后续修改——产品是否 Agent-Ready,正在成为 3D 生成下半场的新门槛。

事实上,前沿通用模型与专业模型的能力之间,并不需要被划成非此即彼的两边。前者能够理解创作目标、调用不同工具,也擅长通过代码生成规则几何体与重复性结构;以 Hyper3D 为代表的专业 3D 生成模型则擅长复杂形体、精细几何和材质的生成。两者可以在同一项任务中协作,也意味着更多人可以通过 Agent 开始创作,专业 3D 能力有机会进入更多工作流。

基于这一理念,Hyper3D 近日上线了最新的智能交互功能 Agentic Mode,将 Hyper3D Rodin 与 LLM 多模态上下文分析能力整合进同一流程,实现自主理解、优化输入,再根据任务选择最合适的建模路径。

值得关注的是,这次更新不只是让生成过程更省事,还把生成能力进一步拓展到工业设计建模——从带尺寸的产品图纸出发,生成可以继续调整的三维模型。

它不是绑定某个通用模型的专属入口,而是内置于 Hyper3D 的能力,让人和不同 Agent 都更容易使用专业 3D 能力。 在这个过程中, 人依然决定创作目标、评判设计取舍,Agent 则可以承担越来越多的具体执行。

01

从创意资产到工业建模,

Agentic Mode 补上了什么?

在进行 3D 生成时,「输入」这一步其实就存在着隐形门槛。

一辆摩托车的参考资料里,可能混着整车正面、侧面、仪表盘、发动机和排气管特写;一张角色设定稿同时画着正面、背面、武器和配件;工业设计人员递过来的,则可能是一张带尺寸标注的产品图纸。

为了更接近想要的生成效果,这些资料在进入生成模型以前,人已经做了不少预处理:先清背景、挑参考图、判断哪些画面属于同一个主体,哪些图片负责整体轮廓,哪些只补充局部细节,再决定这次应该用哪条建模路线。

Agentic Mode 首先接手的,就是这部分往往被当作准备工作、却直接影响生成效果的专业判断。

借助 Agentic Mode,系统可以先从一张并不标准的素材里判断什么才是主体、哪些视觉信息需要保留,再按需增强输入,对不可见部分进行合理推演,减少人工素材预处理与反复调试。

比如这里,左半边是我随手拍下的吴越王钱镠塑像,由于拍摄时是阴天,也没有讲究太多拍照手法,导致除了人物面部不清晰之外,人物手中的弓箭也与背景交错在一起。

在输入这张单一视角的图片后,Agentic Mode 不但精准识别补充了面部细节,也没有将弓箭与树枝混为一谈。甚至转到人物背面图时,衣服的行制与纹理也均与正面图相吻合。

到了工业设计图纸、产品多视图等场景,输入理解的重要性会更加明显。一组参考资料里既有整体,也有局部;不同视角可能属于同一个物体,还可能混着尺寸标注、结构示意和材质参考。系统需要先分清这些信息各自描述了什么,才能进行后面的建模。

以这个餐车案例为例,输入并不是一张普通产品图,而是一组带有 尺寸、结构分区、局部说明和多视角信息 的技术示意图。对传统 3D 建模流程来说,这类输入的难点不在于「看见图片」,而在于能否真正理解这是一份面向建模的工业化信息。

这恰恰是 Agentic Mode 的突破所在。 它不只是降低输入门槛,而是把生成能力从创意资产延伸到工业设计等更广阔的应用领域,承接那些更强调结构理解、规格约束和可迭代性的建模任务。 对于产品概念验证、展示模型制作和工业设计前期沟通等场景,这类能力尤其具有现实价值。

理解输入之后,接下来还要判断合适的建模方式。这也是 Agentic Mode 与简单模型调用拉开差别的地方之一,Agentic Mode 会根据任务自主选择最合适的建模路径。

Agentic Mode 对 Low-poly N-GONS 模型支持可以通过自然语言驱动的参数化控制、动画预设与材质增强等后续编辑功能。这些能力与 Agentic Mode 的输入理解、建模规划相衔接,共同支持「生成、检查、再修改」的创作流程。

最让人惊喜的是下面这个机械手的生成案例,最终模型不只要把机械结构做出来,关节本身还需要能够继续调整和运动。在这一案例中,Agentic Mode 在生成 Low-poly N-GONS 模型后,继续给模型加入动画预设,用动态效果检查关节运动。

在这个案例中,我们也可以清楚看到,生成完整的耳机细节图之后,无论想更改材质、纹路还是颜色,都能通过拖拉拽的方式一键完成。

可以看出,Agentic Mode 要做的,不只是生成一个高质量的模型,而是把生成全流程中的更多专业判断交给 AI。从创意资产到工业建模,读懂设计资料、选择建模方法、生成后继续调整的单独动作被连成了一个完整过程。

02

3D 生成进入「Agent 时代」

内容资产从可生成,到可以进入真实 Agent 工作流的 Agent - Ready 状态,不是 3D 生成独有的变化。

视频生成行业已经经历了类似的演进。

前几年 SeedDance、Runway、Kling 的竞争中,大家的竞争重点都放在了可以生成几秒,画面有多清楚,人物细节与表情是否稳定,镜头运动能不能成立。

等到单次生成越来越强,竞争随即从生成转向 Agent 工作流维度。 例如,Google 今年为 Flow 加入了 Agent,可以在用户控制下处理多步骤创作、生成多个方案、批量编辑并整理素材;Flow Tools 还支持用自然语言创建定制工具与工作流。专业产品开始把原来分散的操作,组织成能够持续推进的创作过程。

这个过程中,随着视频模型越来越强, 专业产品开始把过去散落在人脑子里的制作方法成 Agent 能力的一部分 :什么时候用哪个模型,什么地方值得重新生成,什么地方局部编辑就够,第一轮应该追速度还是质量,几十个镜头之间怎样保留人物和素材状态。而对模型来说,能够更好支持 Agent 工作流的玩家,也明显会拿到更多筹码。

回到 3D,类似的变化还要面对三维资产自身的要求。

对于视频生成来说,用户想要什么样的效果、可以选择什么样的路径,普通人就可以用一些自然语言描述清楚, 但是在 3D 生成场景中,要读懂任务并不容易。 需要能够理解平面图、立体图与尺寸图之间的复杂联系,并且能够将这些复杂联系变成生产路径中的环环相扣的执行。

现在,这些对小白来说难如登天,对专业人士来说过于繁琐的细节,已经全部可以借助 Agentic Mode 交给 Agent 来实现。

此外,生成内容是否可以被修改、可迭代, 能否 适应 具体 的落地场景,也是 专业 3D 生成中的关键要求。

一个视频片段生成以后,还有剪辑和后期;一个 3D 资产生成以后,也可能需要几何编辑、拓扑调整、材质处理、尺寸修改、分件、骨骼绑定和动画,再根据用途进入游戏引擎、AR、3D 打印或仿真环境。

同一辆汽车放进商品展示、赛车游戏和机器人仿真场景,对外观、部件结构和后续处理的要求,并不相同。

相比 Astra 展示出了完整的长链路推进能力,在更具体的 3D 资产生产里,专业模型还在解决另一组问题:复杂形体怎样生成,几何细节和材质怎样满足目标,生成之后,局部能不能被控制与修改?这些能力可以成为 Agent 完成任务时调用的专业工具。

相应的,通用模型和专业 3D 模型之间很难被一句「 GPT 已经会 Blender 了」抹平差距 。

模型能力的上限天花板之外。即使未来通用模型把生成能力继续往前推,专业 3D 生产里仍然藏着大量 Know-How: 输入应该怎么整理,哪种对象走哪种方法,什么时候保留现有资产继续修,什么时候推倒重做,需要进游戏的东西应该提前拆哪些部件,要去仿真的资产又要留下什么结构。

尤其对真实生产场景来说,这些经验还关系到成本的实际问题。当方案有了变化,是只能再生成一个看起来差不多的模型,还是可以针对已有结果继续调整,专业判断能否被 AI 承接,这些都会直接影响修改的成本和工作流的连续性。

Hyper3D 在 Agentic Mode 之前,就已经开始为 Agent 使用专业 3D 能力做准备。例如,Hyper3D Rodin 的生成能力可以通过 MCP 接入 Codex、Claude Code 和 Kimi Code CLI 等智能体。

全球越来越多的创作者正在用「GPT-6+Hyper3D MCP」进行 3D 内容创作

看上去只是多了一种调用方式,却替用户省掉了过去很繁琐的手工操作:接上 Hyper3D MCP 后,在 Codex 或 Claude Code 里做项目的 Agent,需要一个 3D 模型时,可以直接调用 Hyper3D Rodin 的生成能力、等生成完成、拿回结果,不必再打开另一个网页,重新上传素材、等待生成、下载文件,再搬回原来的工作环境。

但 MCP 只能解决部分效率问题。在 3D 内容生成中,更多的 know-how 与时间消耗,其实藏在如何解读用户输入、应当选择什么样的建模路线,以及最终的微调要如何细化 。 这正是 Agentic Mode 要进一步接手的部分。

从这个角度看,Hyper3D 的更新并不是一次突然转向,而是此前围绕真实生产积累的能力,开始面向新一代使用者重新迭代。

03

从 Production-Ready 到 Agent-Ready,

专业 3D 能力如何走向更多人?

把 Hyper3D 过去几年的产品更新串起来看,会发现它前半程一直在解决同一个问题:先让资产可用、可控、能进入生产管线。在这个过程中,核心 3D 生成模型 Hyper3D Rodin 不断迭代,推出自然语言编辑 3D Editing、递归分件 BANG、可控生成 3D ControlNet 等独家可控能力,构成了它对 Production-Ready 的回答。

到了 3D 生成的 Agent 时代,这条产品路线又向前走了一步:界面层通过 MCP 连接外部 Agent,输入层由 Agentic Mode 理解素材、规划建模路径,互动层则提供自然语言编辑、分件等可控能力。Hyper3D 正在把原本由专业用户逐项操作的工具,拓展成能被 Agent 持续使用的 3D 工作台。

这也带来了一个过去很难同时成立的变化:

一方面,3D 内容生成加速向工业设计、游戏资产、仿真、训练这些更复杂、对专业性要求更高的场景落地。

另一方面,使用它的人却可以越来越不专业。用户甚至不需要了解建模背后有几种模型,不需要了解 Blender 与拓扑到底是什么东西,就能生成足够专业的 3D 内容资产。

Agent 没有消灭专业内容生成的复杂性,只是把输入整理、模型选择、生成、修改和后处理之间的大量判断接了过去,成了系统能力的一部分。

于是,一些过去受制于建模成本、来不及反复验证的设计想法,有了更容易进入 3D 创作的机会。

例如,对一个工业设计团队来说,一份产品草图或带尺寸的参考资料,可以先转成可讨论的三维方案;在一个游戏中,不止 BOSS 与核心场景值得被认真制作,小兵与地图的边缘也开始被关注;在具身智能模型训练团队中,一些稀少的 Corner case 除了能用仿真数据模拟,还可以通过 3D 建模生成更逼真的效果;对一个家装设计团队来说,设计师构思好设计概念后,就能立刻完成草图与场景建模,OPC 成为可能。

对创作者来说,重要的不是从此不需要专业知识,而是更少被准备素材和反复操作拖住,能把时间留给方案本身。

技术进步叠加交互方式变革,让 3D 建模成为任何任务中都能够被随机调取的能力。率先将 Agentic 能力引入 3D 生成领域的 Hyper3D,正在让这一切成为现实,而这也才是 3D 内容生成进入 Agent 时代的真正价值所在。

*头图来源: Hyper3D

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

资讯由采集器定时从公开机器人 / AI 信息源自动聚合。

相关内容

国内industry

除了更贵的订阅和砍半的额度,OpenAI 想做的还是「微信」

模型越来越便宜,付费给的用量却砍了半 作者|Alan 北京时间 9 月 30 日凌晨,OpenAI 开完了它口中「迄今规模最大的一届」开发者大会。官方汇总页上一共列了 25 项发布,从新模型、新 API,一路排到给企业买软件用的应用市场。 现场最安静的一刻,出现在 Sam Altman 讲到 ChatGPT Pro 会员调整的时候。台下没有一个人鼓掌。 调整本身不复杂:每月 200 美元的 Pro 200 价格不变,新订阅的用量缩水;另外新增一档 Pro 500,每月 500 美元,用量是 Plus 的 25 倍,外加一个个人套餐里只有它能用的提速档 Astra Ultrafast。 那一阵沉

来源极客公园4小时前
国内industry

刚刚,iQOO掏出年度旗舰,自研电竞芯片性能提升15%,首款电竞平板也来了

智东西 作者 | 陈骏达 编辑 | 心缘 智东西9月29日报道,刚刚,vivo旗下iQOO品牌发布了年度旗舰手机iQOO 16,这台手机搭载了第六代骁龙8超级至尊版,全球首发了由iQOO和三星显示联合研发的2K 165Hz三星珠峰屏,并基于iQOO搭建的“3+2游戏技术版图”,提升了手机在视效、操控、直播和跨端游戏等维度的体验。 同时,iQOO还发布了其首款电竞平板iQOO Pad Ultra,这款产品同样采用第六代骁龙8超级至尊版,并搭配iQOO自研电竞芯片Q4和全新一代Monster超核引擎,还通过五重风冷散热系统、新一代超感触控引擎和自研Q-flex操控技术提升游戏体验。 先来看iQOO

来源智东西9小时前
国内industry

刚刚,DeepSeek Harness桌面端上线,梁文锋开送Token了

智东西 作者 | 江宇 编辑 | 漠影 智东西9月29日报道,今日, DeepSeek正式推出DeepSeek Harness v0.2预览版 ,并提供开箱即用的macOS和Windows 桌面端 安装包。 ▲DeepSeek Harness v0.2预览版界面 用户前往DeepSeek Harness官网下载安装后,按照引导即可直接使用,无需再自行配置开发环境。 这是DeepSeek Harness自8月13日晚推出开发者预览版v0.1并同步开源后的又一次重要更新。 此次v0.2进一步补齐了 桌面端产品体验 ,不仅 预置日常办公和开发中的常用功能 ,还新增 插件安装与管理页面、自动化任务 等

来源智东西9小时前
国内industry

AMD 82 亿美元收购 World Labs,买的不只是世界模型

9 月 3 日,英伟达宣布以约 130 亿美元收购 Hugging Face。25 天后,AMD 宣布以约 82 亿美元收购李飞飞创办的 World Labs。 两笔交易放在一起看,更觉得有意思。CNBC 最新的报道提到,Hugging Face 在被英伟达拿下之前,AMD 和 Salesforce 都曾表达过收购兴趣。 没抢到 AI 世界里最大的模型「集散地」,AMD 转身买下了一支造模型的顶级团队。 根据 AMD 的公告,这是一笔全股票交易 ,预计在 2026 年底前完成交割,仍需通过监管审批。交割之后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。 这也是 A

来源极客公园12小时前
国内industry

让Token像土豆一样便宜,要闯哪四关?

进入2026年下半年,全球算力涨价潮持续发酵。 “让全世界更多的人,像享受土豆一样,享受Token。” 9月19日,央视《对话》走进远景乌兰察布星河基地,远景科技集团创始人张雷用这个比方,提出了一个看似简单的问题: AI怎样才能更普惠? 这句“AI土豆论”很快在算力圈引发讨论,背后是全行业共同的成本焦虑: AI算力的门槛,实在太高了。 就在节目播出三天后,小米发布MiMo-V2.6,并公开了全程直播的“炼丹”账本,把这份昂贵具象化:MiMo-V2.6的Pro与Flash两个版本,仅强化学习后训练阶段就跑了不到6天,合计烧掉了 347万美元 , 约合人民币2344万元 。 这还只是后训练环节。据

来源智东西13小时前
国内industry

Anthropic 招股书里,最耐人寻味的 7 个细节

作者|Techno 之王 编辑|靖宇 当地时间 9 月 28 日,外媒披露了一份 Anthropic 的 IPO 招股书。 先要说清楚这份文件的性质。它并不是 Anthropic 主动公开的版本。今年 6 月,Anthropic 以公益公司身份向美国证交会秘密递交了 S-1 注册声明草案,为普通股首次公开发行做准备。按照规则,公司要在向机构投资者路演前至少 15 天公开递交修订版 S-1,完整财务数据到那时才会被外界看到。路透此次看到的是一份尚未公开的版本, Anthropic 对此拒绝置评 。 这意味着其中的数字仍可能随证交会的审阅意见调整,不少细节也只能通过路透的转述窥见一角。 但如果这份

来源极客公园14小时前