登录注册
首页
AI 大模型体验中心AI 大模型体验中心AI 大模型体验中心
动手实验室动手实验室动手实验室
Agent 评测集Agent 评测集Agent 评测集
AI 案例广场AI 案例广场AI 案例广场
火山杯大赛学习中心
社区
去发布
首页
AI 大模型体验中心AI 大模型体验中心AI 大模型体验中心
动手实验室动手实验室动手实验室
Agent 评测集Agent 评测集Agent 评测集
AI 案例广场AI 案例广场AI 案例广场
学习中心
社区
初次见你
初次见你
文章
专栏
问答
初次见你
初次见你
跨帧语义传播:starverseAI如何把首帧特征传递至后续全部帧
AI实时音视频
用一张图生成视频,听起来很美好。实际用过的人都知道,问题出在后面。首帧好好的一张脸,生成到第五帧就变了模样;首帧清晰的文字,到了第三帧就糊成一团;首帧的色调和构图,走着走着就偏了。根源是首帧特征没有效传递到后续帧。跨帧语义传播,解决的就是这件事。先说最基本的概念。图生视频(I2V)的输入是一张参考图,输出是一段视频。参考图是视频的"起点"——第一帧基本就是参考图本身,后续帧从这一帧自然演化。但"自
4
0
0
0
初次见你
初次见你
参数、协作、团队管理全覆盖,AI 商业视觉平台深度拆解
AIAIGCAI绘画
当前 AIGC 视觉工具大量面向 C 端创意场景,但商业项目对主体一致性、参数可控、版本追溯、团队权限、版权合规有着硬性要求。普通 AI 绘图、短视频工具很难满足品牌广告、电商物料、短剧宣传片的工业化生产诉求。星宇智算 AI 视频工作台,也就是 AI 商业视觉创作平台,面向 B 端商业生产打造,整合图像、视频生成、节点式画布、媒资库、多角色权限体系,提供 SaaS 网页、星桥 API、私有化部署三
35
0
0
0
初次见你
初次见你
Vera1.1 提示词技术进阶:不只写描述,学会控制时序与运动强度
音视频实时音视频
在 AI 视频生产实践里存在一个普遍误区:认为只要把提示词写得足够详尽,模型就可以输出符合预期的运动效果。但大模型文本理解存在固有边界,文本很难量化表达 “镜头缓慢推进”“小幅度肢体动作”“稳定无抖动” 这类连续时序信息。单纯依靠文字描述运动,结果具备很强随机性。同样一段提示词,多次生成会出现镜头剧烈晃动、动作夸张过度,或者完全静止不动两种极端。星宇智算 Vera1.1 的设计思路,将能力拆分为两
40
0
0
0
初次见你
初次见你
多参考图输入,Vera1.1 融合多张图片生成视频技术体验
音视频实时音视频
在实际业务落地中,单张参考图驱动视频一直存在几个顽固痛点:角色形象跑偏、场景前后割裂、道具细节丢失。很多团队做短剧、漫剧、电商物料时,需要把人物定妆照、场景环境图、道具参考图多张素材同时喂给模型,保证整段视频里人物样貌、服饰、场景布局全部对齐。过去多数文生视频模型仅支持单图输入,多张参考图只能反复迭代提示词、多次 LoRA 微调,调试周期拉长,团队内部经常出现美术输出参考图和 AI 输出视频严重脱
33
0
0
0
初次见你
初次见你
双流 DiT 架构加持,Vera 1.1 攻克 AI 视频 “人物漂移” 顽疾
音视频实时音视频
传统单流视频 DiT,全部视觉信息(人物、背景、运镜、光影)输入同一个 Transformer 时序分支。当镜头移动、环境光影变化、物体交互时,背景信号会污染人物身份表征,出现人物特征被改写的现象。在漫剧、电商短剧、多镜头数字人等商用场景,漂移问题会直接导致成片报废,返工成本极高。| 问题现象 | 底层成因 | 业务侧影响
37
0
0
0
初次见你
初次见你
为什么人物不再变脸?Vera 1.1 身份表征留存技术全解析
大模型大模型
在文生视频、图生视频业务场景中,大量开发者都会遇到一类共性现象: 输入同一张人物参考图,生成多段连续视频,随着镜头切换、动作变化、光照改变,人物五官、脸型、发色会逐步偏移,也就是行业俗称 “变脸”。即便增加参考图数量、锁面部权重,依然会出现身份丢失。短时帧内漂移:单条视频内部,几十帧之后五官细节发生改变,眉毛、眼睛轮廓、脸型发生潜移默化变化;跨片段身份断裂:多段视频接力生成,上一段人物样貌,下一段
42
0
0
0
初次见你
初次见你
详解 Vera1.1 的光流优化,提升视频流畅度的底层能力
音视频实时音视频
做 AI 视频的同学应该都有同感。哪怕画面渲染质感到位,一旦出现物体错位、帧间跳变、局部画面撕裂,整条视频直接废掉。很多团队把问题简单归为模型效果差,反复调 Prompt、拉高渲染分辨率,实际收效甚微。大量线上业务反馈,70% 以上的视频不流畅问题,根源并不在画面生成,而是帧间运动对齐与光流计算环节。用户高频疑问 1:同样的人物场景,短片段看着没问题,一拉到 8 秒、12 秒长视频就疯狂跳脸,这到
16
0
0
0
初次见你
初次见你
量化实验:Vera1.1 无限画布视频的 FVD、人物偏差率测试结果
音视频实时音视频
做 AI 视频量产的团队,大多踩过同一个坑:无限画布看着 demo 效果不错,批量跑起来就频繁翻车,人物漂移、帧间闪烁全来了。肉眼评价太主观,不同人标准不一样,版本迭代根本没法精准对齐。有开发者常问:**无限画布外扩之后,时序稳定性到底打了多少折扣?**也有业务方纠结:人物漂移有没有可量化的商用合格线?这也是我们团队做这次量化实验的初衷。我们以星宇智算 Vera1.1 为测试对象,选取行业通用的
25
0
0
0
初次见你
初次见你
Vera1.1 模型细节:无限画布模式下掩码生成与图层合成技术
音视频实时音视频
做 AI 宽幅延展、横向长镜头、漫剧分镜扩展的时候,很多同学都遇到过很头疼的现象:画面向外延展之后,新旧区域拼接处出现硬接缝、主体漂移、光影割裂,明明提示词写得没问题,扩出来的画面就是 “贴上去” 的感觉。不少开发者会问:**同样是 out‑painting,为什么无限画布模式的问题比普通局部重绘要严重得多?掩码在这里到底承担了什么样的角色?**也有业务侧同事经常抛出疑问:无限画布的图层合成,能不
18
0
0
0
初次见你
初次见你
不用懂深度学习,带你读懂 Vera1.1 分镜节点化长视频生成逻辑
音视频实时音视频
做 AI 视频的朋友应该都有体会,现在生成几秒的惊艳片段很容易,一做长视频就翻车。人物漂移、场景跳变、光影不连贯,各种问题扎堆出现。据《2026 AIGC 工程化落地白皮书》统计,长视频生成的一致性问题,是阻碍企业规模化应用的第一技术障碍,占比达 68%。很多刚接触这个领域的开发者和内容从业者都会问:“我完全没学过深度学习,能不能理解长视频生成的核心逻辑?” 还有人吐槽:“都是把片段拼起来,为什么
82
0
0
0
初次见你
初次见你
Vera 1.1 技术深度解析:时空解耦 DiT 架构如何解决视频时序漂移问题
音视频实时音视频
做过 AI 长视频的开发者大概率都踩过同一个坑:前几秒画面还稳得很,十几帧一过人物脸就歪了,场景元素凭空消失又凭空出现,镜头运动轨迹突然断裂。这不是参数调得不够细,而是扩散模型天生的时序一致性难题 —— 业内统称「时序漂移」。今天这篇就从工程落地视角,拆解星宇智算 Vera 1.1 主推的时空解耦双流 DiT 架构,讲清楚它到底从哪几个维度解决了长视频时序漂移问题,以及我们团队在实际项目中测出来的
40
0
0
0
初次见你
初次见你
无限画布多镜头视频生成:时序注意力与空间渲染协同原理
音视频实时音视频
很多团队在用无限画布做分镜多镜头视频的时候,会碰到一类很头疼的现象。单镜头画面看着精致,一切换到下一个镜头,人物样貌、道具、色调就跑偏。有开发者会问:**明明每个镜头都用了同一张参考图,跨镜头角色还是会变形,问题到底出在哪?**也经常听到业务同学的疑问:同样一套提示词,在画布节点串联生成,和单独生成每一段,效果为什么完全不一样?这不是简单提示词写得不好,本质是时序注意力与空间渲染两者协同失效。无限
35
0
0
0
初次见你
初次见你
实战案例:图文素材一键转商品视频,Vera 1.1 业务实践
音视频实时音视频
电商平台商品内容更新频率高、SKU 数量大,传统实拍剪辑模式存在周期长、成本高、风格难统一的痛点。将现有商品主图、详情页图文素材一键转换为短视频,是降本提效的核心落地方向。星宇智算・Vera 1.1 针对电商场景优化主体畸变抑制、材质纹理保留、智能运镜匹配三大模块,支持单张 / 批量图文素材输入,快速生成可用于店铺挂载、信息流投放的商品短视频。直接用通用图生视频模型处理电商图文,会遇到四类高频商用
4
0
0
0
初次见你
初次见你
从实操落地看 Vera1.1 参考图引导,聊聊生成一致性在生产场景的真实表现
大模型大模型
在商业 AI 视觉生产中,参考图引导生成是 IP 角色延续、系列物料、品牌视觉统一的核心链路,中国信通院《生成式人工智能产业白皮书》指出,图像跨实例一致性是制约 AIGC 工业化落地的关键短板之一。多数模型存在风格漂移、主体特征丢失、构图错位等问题,直接拉高后期修图成本。本文基于星宇智算 Vera1.1 开展多组对照实验,结合量化指标、参数调优、团队协作流程,客观呈现参考图引导模式下的一致性表现,
17
0
0
0
初次见你
初次见你
多组对照测试:Vera 1.1 长片段视频生成优缺点完整梳理
音视频AIGC
短片段 AI 视频在画面质感上已经达到商用门槛,但长片段视频生成依旧是多模态模型的主要难点。随着视频时长增加,会依次出现特征遗忘、时序漂移、物体异变、语义跑偏、光影跳变等一系列问题。星宇智算・Vera 1.1 针对长片段场景优化滑动时序注意力、分段特征缓存模块,同时保留模型客观存在的能力边界。本文基于内部多组对照样本数据,从参数配置、量化指标、业务适配、团队生产流程做完整梳理,所有数据来源于线上生
18
0
0
0
初次见你
初次见你
Vera 1.1 模型能力解析:国产文生视频模型输出能力工程检验
大模型大模型AIGC
摘要:国产文生视频模型已经从演示效果转向工业化内容交付,语义还原、时序稳定性、物体逻辑、硬件资源开销共同决定业务可用率。本文基于 VBench 公开评测框架开展批量推理统计,覆盖文生视频、图生视频两大链路,测试样本共 160 组,涵盖电商商品、写实人物、二次元、环境场景四大类别;输出规格 720×1280,6 秒,24fps;采样步数 30 步;推理硬件 NVIDIA A10‑24GB。全部数据来
7
0
0
0