腾讯ARC实验室是腾讯面向人工智能前沿技术开展研究与成果转化的实验室,肩负探索和挑战前沿技术的使命,致力于成为世界一流AI实验室和行业标杆。其公开成果覆盖3D生成与重建、视频生成与控制、视觉基础任务、图像生成与编辑、视频基础任务及视频理解等方向。与只展示单一应用的工具不同,ARC同时呈现论文研究、开源项目、模型成果和技术落地案例:自2019年起在CVPR、ICCV等顶级会议与期刊上发表论文160余篇,并将GFPGAN、YOLO-World、VideoCrafter、SEED-Bench、DepthCrafter等核心成果开源,为全球社区提供工具与基准。
核心功能
单图生成3D模型
InstantMesh是高效的前馈式3D网格生成框架,能够利用单张图片在数秒内生成高质量的3D模型。该成果属于3D生成与重建方向,页面同时提供论文查看入口,适合了解其研究方法与模型成果。
个性化人物图像生成
PhotoMaker是个性化文生图模型,可接收任意数量的人脸照片作为输入,并结合文本提示生成定制人物图像。页面将其描述为能够在几秒内生成高保真、风格多样化的定制人物图像,输入形式包括人脸照片和文本提示。
视频深度估计
DepthCrafter面向视频深度估计任务,具有时序稳定、细节丰富的特点,并支持开放世界视频。它属于视频基础任务成果,页面展示了该模型的研究论文入口,但没有进一步说明具体部署方式或使用条件。
静态场景运镜生成视频
ViewCrafter能够对任意图片进行运镜拍摄静态场景,并生成对应的视频结果。它属于视频生成与控制方向,处理对象是图片,输出结果是视频,页面未提供更详细的参数、格式或操作步骤。
文本引导图像编辑
BrushNet是用于文本引导图像编辑的轻量级模型,通过引入基于笔刷的掩码机制,让用户更灵活、精细地控制扩散模型生成的编辑区域。该成果聚焦图像生成与编辑,核心控制方式是文本提示结合笔刷掩码。
视频内容理解
ARC-Hunyuan-Video-7B专门针对真实世界的视频理解任务设计,支持横屏和竖屏视频的结构化理解。页面称其视频描述总结能力在同量级模型中SOTA,并列出其相较Qwen2.5-VL-7B、Qwen2.5-Omni-7B、InternVL-2.5-8B和InternVL-3-8B的表现优势。
使用方式
给定正文展示了研究成果、模型介绍和“查看论文”入口,并说明开源项目为全球社区提供工具与基准。页面还列出“更多研究”入口,但没有说明是否需要注册、是否提供客户端、API或命令行,也没有说明是否需要自备模型Key、支持哪些导入导出格式。
适用人群与场景
从公开成果看,人工智能研究人员可通过论文和研究项目了解3D生成、视频理解及视觉基础任务;模型开发者可关注GFPGAN、YOLO-World、VideoCrafter、SEED-Bench、DepthCrafter等开源成果。图像创作者可参考PhotoMaker进行个性化人物图像生成,图像编辑场景可使用BrushNet的文本与笔刷掩码控制;视频创作者或研究者则可关注ViewCrafter的视频生成、DepthCrafter的视频深度估计和ARC-Hunyuan-Video-7B的视频结构化理解。
注意事项
给定正文没有提供具体价格、免费额度、注册要求、接口文档或模型部署说明,因此无法据此判断具体使用门槛。页面内容同时包含实验室研究、论文、开源项目和产业落地成果,不等同于单一的人脸修复在线工具说明。