
——第二届 DGX Spark 黑客松开发复盘一、项目背景从 Agent Anything 到数字资产实体化随着生成式人工智能的持续发展AI 的角色已经从单纯生成文本、图像和代码的工具逐渐演变为能够理解任务、调用工具并组织复杂流程的智能系统。Agent Anything 所代表的不仅是一种更强的大模型能力更是一种新的应用设计方式系统不再只输出结果而是需要围绕目标去思考该如何行动。正是在这样的背景下Orbis 团队开始思考一个问题如果 AI Agent 不只是处理数字内容而能够理解现实对象、协调不同模型并完成端到端任务它是否能够帮助数字世界与现实世界建立更直接的连接这成为本次项目的真正起点。图1项目愿景——从现实对象输入到数字重建与优化再到纸模实体输出。在黑客松启动后Orbis 团队围绕“Agent Anything”进行了多轮方向讨论。最初进入深入分析的方案有两个。第一个方向是基于味觉、视觉和听觉融合的 AI 食物体验系统希望通过多模态信息构建更丰富的食物评鉴过程但进一步分析后团队发现味觉数据高度依赖个体主观感受不同用户在风味、口感和评价标准上存在较大差异短时间内很难建立稳定、统一的数据表达体系。第二个方向则是数字资产实体化即让现实世界中的物体通过图片或视频进入数字空间再让数字空间中的模型资产重新回到现实以纸模的形式被创造、被分享、被体验。相比前者这一方向更适合结合视觉理解、3D 生成、AI Agent 和几何优化等能力也更容易形成完整闭环因此最终被确定为项目的核心方向。项目一旦确定团队对其目标也进行了重新定义。我们并不希望只做一个“图片转纸模”的工具而是希望构建一条从现实对象出发经由数字理解和数字重构再回到现实创造的完整链路。现实中的物体可以通过图像进入数字空间数字空间中的资产也可以借助 AI 完成语义理解、结构重构和实体制作。这种“现实 → 数字 → 实体”的流程正是 Orbis 团队在本次黑客松中希望探索的核心命题。二、十日开发历程从 Idea 到 Demo7 月 12 日DGX Spark 黑客松训练营正式开始也成为项目真正进入开发阶段的起点。十天开发并不是一条预先设计好的直线路径而是在不断学习、实验、修正和重新组织中逐渐成形的过程。回头看这十天并不是简单地把一个初步想法写成代码而是把“数字资产实体化”从概念逐渐变成可运行 Demo 的过程。图2十日开发时间线——从训练营学习、技术选型、模型实验到最终展示的完整历程。Day 1训练营学习与 Agent 思维建立在第一天的训练营中团队最重要的收获并不是某个具体模型的参数或某个工具的使用方法而是对 Agentic AI 的理解发生了变化。在训练营之前团队更多将 Agent 理解为“让语言模型可以调用工具”但随着案例学习深入我们逐渐认识到一个真正有效的 Agent 系统需要围绕目标进行任务分解、能力调用和结果校验。对于本次项目而言这种变化直接影响了产品形态如果系统只是“输入图片输出结果”它仍然只是单点模型应用但如果系统能够理解用户想制作的对象、决定需要哪些模型参与、组织不同模块完成连续任务那么项目就不再只是纸模生成工具而是一条由 AI Agent 驱动的智能创作流程。Day 2技术路线设计与整体流程确定在明确 Agent 逻辑之后团队开始进一步梳理产品路径。最初看起来问题似乎可以被简化为“用户输入一张图片系统输出一个纸模”但真正落到实现上我们很快发现中间存在许多不可跳过的步骤。系统需要首先理解图片中的对象及其语义然后提取用户真正关注的目标再通过三维生成完成数字重构之后还要面对模型复杂度控制、几何优化和纸模展开等问题。也正是在这一天项目的整体流程逐渐清晰输入层支持图片、视频和已有数字资产前端理解层负责视觉识别和语义分析三维层负责 3D 生成与重构几何处理层负责模型抽象与制造适配输出层负责纸模展开和制作说明生成。项目从这一刻开始不再是一组离散想法而是一条具有明确阶段分工的产品链路。Day 3模型实验与第一次技术挑战第三天团队开始进入模型实验阶段重点验证视觉理解模型和 3D 生成模型的效果。最初团队对现有模型能力抱有较高期待尤其是在三维生成部分我们一度认为只要能得到一个视觉上足够真实的 3D 模型后续就能够自然衔接到纸模制作流程中。实验很快打破了这一假设。以 Segment 类视觉模型为例它能够帮助系统识别图片中的对象区域但在真实场景中系统真正要解决的问题并不是“图像里有什么”而是“用户真正想制作什么”。当一张图片里出现多个对象、复杂背景或遮挡关系时仅有分割结果并不足以完成目标理解语义理解的重要性开始凸显。另一方面3D生成的实验结果在视觉上令人印象深刻结构完整、细节丰富、整体效果接近真实。但当团队尝试进一步把这些模型转化为纸模时问题马上出现了——高密度 Mesh、复杂曲面和不适合展开的拓扑让后续流程寸步难行。第三天最大的结论是视觉真实性并不等于制造可行性三维生成模型输出的“好看”结果并不能直接变成“能做”的纸模。Day 4-5Agent 流程整合与混合架构形成在完成基础模型验证之后项目开始进入系统整合阶段。此时团队面对的关键问题已经不是“某个模型能不能跑起来”而是“不同模型如何形成一个完整流程”。与此同时真实应用中的数据隐私问题也浮出水面。由于系统需要处理用户上传的图片和现实场景信息如果所有数据直接发送到云端模型虽然可以利用更强的推理能力但也会带来数据风险。因此团队逐步形成了一套混合式 AI 架构本地 Qwen 模型负责输入理解、信息提取、隐私预处理和初步任务规划在完成去隐私和结构化处理后再将必要信息发送给 StepFun API用于更复杂的语义推理和高级分析。在这一阶段AI Agent 的角色也变得更加清晰它不直接代替某个模型工作而是作为任务协调中心将视觉理解、3D 生成、几何处理和输出生成组织为连续步骤。项目由此从“模型组合”转变为“工作流系统”。Day 6-7模型抽象与纸模生成第六天到第七天项目进入最核心也最困难的技术阶段如何把一个复杂数字模型真正变成用户可以制作的纸模。团队首先尝试通过降低模型面数来简化 3D 结构但实验很快表明简单减少 Polygon 数量会直接破坏物体特征。汽车模型会失去车轮和比例建筑模型会丢掉门窗和空间关系动物模型则会失去身体轮廓和识别特征。因此模型抽象不能只是几何上的压缩而必须结合语义保持让不同类型对象保留各自最重要的结构信息。随后项目进一步进入纸模展开阶段。三维模型如何切割、如何展开、哪些边需要折叠、哪些区域需要粘贴看似是几何操作实际上直接影响最终用户是否真的能够完成制作。早期结果虽然可以生成展开面但往往会出现面片过多、拼装关系复杂、制作门槛过高的问题。因此团队持续在切割策略、折线组织和说明表达方式上进行调整目标不再是生成一张数学上成立的展开图而是生成一份用户真正可以理解和制作的纸模方案。Day 8-9Demo 优化与体验完善当基础链路逐渐跑通后团队进入了最后一轮集中优化。这个阶段最重要的发现是技术能够运行并不意味着它已经成为一个好的 Demo。前期开发更多关注模型是否可用、流程是否能够打通但最终展示要求系统不仅能够完成任务还要让用户理解它为什么有价值。因此团队重新审视展示逻辑不再把 Demo 组织为一系列独立的技术步骤而是重构为一条清晰的产品故事线输入一个现实对象AI 理解对象含义完成三维重构对模型进行制造适配最终生成纸模和制作说明让数字资产重新回到现实。在这一阶段产品侧重点转向输入体验、过程展示和输出呈现方式算法侧则继续优化模型稳定性和结果质量系统侧进一步梳理 Agent 流程和模块之间的衔接。项目开始从“技术验证”转向“产品表达”。Day 10最终展示与完整闭环形成到第十天Orbis 团队最终完成了可演示的闭环 Demo。系统支持用户输入图片、视频或已有数字模型并能够完成对象理解、主体提取、三维生成、模型优化、纸模展开和制作说明生成。更重要的是Demo 最终展示的不只是一个技术结果而是一整条“现实对象进入数字空间再重新回到现实创造”的产品逻辑。回顾这十天项目最重要的收获并不是完成了某个单点模型或某个单独功能而是把一个模糊的概念真正组织成了完整可运行的智能创作系统。三、技术探索AI Agent、多模态理解与数字资产转换从技术层面看项目真正有价值的地方并不在于使用了多少模型而在于这些能力如何被组织成一个连贯系统。AI Agent 在其中承担的是任务协调中心的角色它需要理解输入目标决定调用哪些模型并在执行过程中管理中间状态和输出结构。多模态理解则是系统能够连接现实对象与数字资产的基础。图片、视频和已有数字资产在表面形式上不同但在系统内部都需要被转化为可处理的语义对象。3D 生成模块负责数字重构使对象进入可继续操作的三维空间几何优化模块则把“适合看”的模型调整为“适合做”的模型纸模输出模块最终完成现实回归。整个项目的技术思想可以概括为利用 Agent 组织多模型协作完成从现实输入到实体输出的完整数字资产转换流程。图3DGX Spark Agent——本地理解、云端推理、任务编排与结果输出的完整工作流程。四、工程挑战与踩坑复盘项目开发过程中最具代表性的工程问题主要集中在四个方面。第一高质量 3D 模型与制造需求之间的冲突。3D 模型生成的结果在视觉上很强但复杂曲面、高密度网格和缺少制造约束使其无法直接用于纸模制作。第二视觉分割与用户意图之间的差距。Segment 解决的是“哪里有物体”但真实产品场景需要解决的是“用户真正希望制作哪个对象”这迫使系统必须引入更强的语义理解。第三模型抽象并不能简单等同于降低面数。过度简化会直接损坏关键结构因此需要围绕物体语义进行有选择的保留。第四纸模展开不是单纯的几何变换问题。切割位置、折线组织、粘贴区域和说明方式都会影响最终可制作性。也正是在这些问题的推动下项目从“单次生成结果”逐渐演化为“面向真实制作体验的系统方案”。五、NVIDIA DGX Spark 开发体验DGX Spark 对本次项目的价值并不只是提供一个可运行模型的环境更重要的是它帮助团队以更贴近真实应用开发的方式组织整个过程。7 月 12 日训练营让项目在一开始就接触到 Agentic AI 的设计方式团队不再只关注模型能力而开始关注工作流、任务拆解和工具协同。进入实际开发后DGX Spark 又成为本地模型实验、多模型验证和 Agent 流程测试的重要支撑环境。围绕本地 Qwen 和 StepFun API 形成的混合架构也是在这种环境中逐步打磨出来的。对团队而言这次开发体验最大的启发在于AI 应用开发的关键不只是选择强模型而是如何在合适的平台上把不同模型能力组织成真正可运行的系统。六、最终成果与未来方向最终Orbis 团队完成了一个面向数字资产实体化的 Demo 系统。用户可以输入现实对象图片、视频或已有数字模型系统通过 AI 理解、三维重构、几何优化和纸模展开生成可打印、可裁剪、可拼装的纸模方案并输出制作说明。这一成果证明数字资产实体化不仅可以作为一个有趣的创作方向存在也可以成为 AI Agent、多模态理解和数字制造结合的实践入口。未来团队希望进一步把这一方向扩展为更完整的平台一方面支持更多数字资产类型例如游戏角色、AI 生成内容和工业设计模型另一方面结合 3D 打印、AR/VR 展示和智能制造能力让“数字内容重新回到现实世界”的过程变得更自然、更高效也更具创造性。结语回顾整个开发过程Orbis 团队真正完成的并不仅仅是一个纸模生成 Demo而是一次围绕“数字资产如何回到现实”展开的完整探索。这个过程既包括项目构思、模型实验和工程踩坑也包括对 AI Agent、数字理解与实体创造之间关系的重新认识。对于我们而言本次黑客松的意义不只在于完成展示更在于验证了一条新的创作路径AI 不仅能够生成数字内容也可以成为连接数字世界与现实创造的重要桥梁。