从一张照片到3D世界,浙大总部园企业「极顶数创」想把“造物”权还给每个人来源:余杭融媒体中心 最近,鸿蒙系统上的3D相机火了。打开手机拍张照片,几十秒后,一个可以360度旋转、连纹理细节都清晰可辨的3D模型就出现在屏幕上。这是鸿蒙系统上第一个3D大模型原生应用V2Fun正在做的事情。
6月13日,华为开发者大会在东莞松山湖举行,V2Fun在“鸿蒙星光大道”展区正式亮相。背后的团队极顶数创,创始人嵇盼本科毕业于浙江大学竺可桢学院,博士毕业于澳大利亚国立大学,曾任腾讯XR Vision Labs负责人,3D视觉、AIGC领域专家。今年,他把企业杭州研发中心正式落在了位于余杭的浙大校友总部经济园。 “拍张照,生成你的3D模型。”嵇盼这样概括V2Fun。这句话听起来轻巧,背后却是一场持续了十五年的技术长跑。 打破2D到3D的墙 十多年前,嵇盼在浙大信电系做本科毕业设计,课题就关于“2D转3D”。当时《阿凡达》带火了3D电影,许多人在畅想未来的3D数字电视,但一个致命瓶颈横在面前:没有3D内容。最现实的路,就是把海量的2D画面转成3D。嵇盼的入门,就从这里开始。 此后他去澳洲读博,去硅谷做VR,回国后在腾讯带XR实验室的团队,一路都在跟3D打交道。真正让事情发生质变的,是近几年大模型的爆发。
以前做一个高精度的3D模型,专业团队要以月为单位来制作。更别提普通人,几乎没有任何可行的途径。有过一些自动化尝试,比如用深度传感器绕着物体扫描重建,但设备重、流程杂,扫出来的模型经常有破面和材质失真。也有基于深度学习的小模型方案,但这些方法的问题是“泛化性”太差——训练时见过的东西能建出来,没见过的就完全不行。 大模型改变了这个局面。“大模型通过海量3D语料训练,学到了泛化能力。”嵇盼解释,“你给它一张照片作为提示词,它就能输出一个带纹理、带材质的高质量3D模型。”换句话说,模型见过足够多的物体之后,即使面对一张全新的照片,也能合理“推理”出物体背面、侧面应该长什么样。 这背后是企业自研的3D大模型。从数据收集处理、模型架构设计到训练策略和工程部署,全是团队自己闭环做下来的。3D数据的格式千变万化,游戏、建筑、动画各有各的标准,光是数据的收集和清理就是一道高门槛。而模型架构也没法直接照搬图像或视频生成的路子,得专门为3D设计一套。再加上3D数据的总量远不如文本和图片那样海量,在小数据量下还要做出好的泛化效果,难度陡增。嵇盼说得很朴素:“就是不断试错,分析哪个方案行、哪个不行,找到背后的原理。” 华为选择与这个成立仅一年多的初创团队深度合作,看中的正是他们模型的还原度。“特别是在人像还原度上远超竞品”,嵇盼说。这个指标之所以关键,是因为做C端产品,用户想要的是“我的宠物”“我的孩子”,如果生成出来的东西跟原图不像,整个体验就失去了意义。 我们为什么需要3D 对于普通用户来说,V2Fun目前最直接的使用场景是“实体化”。拍下宠物的照片生成3D模型,再通过3D打印做成手办寄到家里,这种带有强烈情绪价值的定制体验,正在吸引第一批用户。 而在专业端,变化已经在发生。有独立原画师用V2Fun的网页端工具,几个星期就把以前工作室三四年没做完的游戏小镇雏形搭了出来。做数字人的创作者,以前以周为单位的模型制作,现在压缩到了小时级。
这不仅仅是好玩或者提效。往更深一层看,嵇盼和团队在做的,是给未来的3D世界模型打地基。当前的大模型对世界的理解基本停留在文字和2D图像层面,而真实世界是三维的。“要让机器人真正走进千家万户,自己去拿东西、干活,缺的就是3D能力。”嵇盼说,“这块能力的补足,必须在数据和基建层面去做。”V2Fun让每个人都能低门槛创作3D内容,本质上是在为未来积累数据和素材。 把研发放到余杭,对嵇盼来说是一个很自然的选择。浙大校友总部经济园这个平台能把浙大人的资源链接起来,余杭政府还给了实打实的研发补贴支持。同时,杭州有做具身智能的“六小龙”企业,浙江有发达的3D打印硬件生态,这些都可能成为未来的合作伙伴。 V2Fun的上线只是一个起点。它的网页端已经在服务专业创作者,手机端从华为鸿蒙起步,明年将逐步扩展到其他终端。把3D创作的门槛从“专业团队用专业软件花数周”降到“任何人用手机花几十秒”,这条平权之路才刚刚开始。 来源 | 余杭融媒体中心 |