标签:多模态
Kimi K3 发布 47 页技术报告,最有价值的创新点是这些
Kimi K3 发布了具备 2.8T 总参数、104B 激活参数以及 100 万 token 上下文的大模型,其核心技术致力于解决模型规模扩大、上下文延长及智能体长时间工作所带来...
Black Forest Labs发布Flux 3!初评超过Seedance 2.0,将开源
黑森林实验室最新发布的新一代模型标志着其从单一图像生成向全面多模态架构的重大进化。该模型将视频、音频及动作预测统一整合,致力于通过同时处理多种感官...
我们让 vivago R1 拍了一部土耳其山寨「星战」,结果出乎意料
智象未来近日发布了全球首个具备无限时长内容创作能力的多模态智能体vivago R1,标志着AI视频生成领域的竞争焦点正发生转移。在AI视频赛道,行业护城河正逐渐...
腾讯悄悄上线了他们第一个设计Agent – Miora。
腾讯WorkBuddy团队推出的设计智能体平台Miora现已全面开放,正式进军智能设计市场。该平台涵盖品牌设计、影视创意、电商广告、互动游戏和网页应用五大主流方...
Meshy 完成近 4 亿美元 B 轮,AI 3D 为什么能长出一家百亿公司
AI 3D生成公司Meshy近期完成近4亿美元B轮融资,投后估值超百亿元人民币,刷新了该领域迄今规模最大的单轮融资纪录。在众多AI创业公司仍依赖融资维持运转时,...
所有人都在卷 Coding Agent,商汤说下一个能「交付」的行业是设计
在AI行业普遍聚焦代码生成领域的背景下,商汤科技选择押注设计赛道,推出了面向长程任务的交付级原生多模态智能体基座SenseNova U1 Pro。传统AI生图模型在真...
不卷视觉,卷“手感”!千觉机器人发布首个VTLA具身触觉模型与千小时数据集
当前具身智能行业高度依赖视觉大模型,但在真实工厂产线或物流仓储等物理交互场景中,单纯的视觉方案难以捕捉受力变化、滑移趋势和接触状态,导致机器人在精...
AI视觉原生统一!商汤开源视觉任务大统一模型SenseNova-Vision
商汤科技正式发布并全面开源日日新 SenseNova-Vision 理解生成统一视觉大模型,完成了大模型体系的重要视觉能力升级。该模型创新性地将各类计算机视觉任务统...
阶跃发布端侧全家桶,1加N架构100毫秒本地调用
阶跃发布了Step Edge系列端侧多模态模型,采用“1加N”架构,旨在实现实时响应、数据隐私保护和推理成本优化。该系列由一个文本视觉基础模型和音频、GUI、图像...
小扎“消失”三年后发帖,只为它:Meta最强Agent模型进军编程
Meta在AI负责人Alexandr Wang的领导下,正式发布了面向智能体编程的多模态AI模型Muse Spark 1.1,旨在智能体任务和编程领域与OpenAI和Anthropic等公司的同类...




