介绍商汤科技的日日新大模型体系:从计算机视觉起家的 AI 公司构建的多模态模型平台,包含语言、文生图、数字人视频等能力,数字人视频生成是特色方向,适合对视觉 AI 感兴趣的读者。

关键信息

  • 研发方:商汤科技(中国)
  • 所属阵营:国内
  • 阅读难度:入门
  • 预计阅读:约 7 分钟

核心要点

  • 出身以视觉技术闻名的商汤科技,多模态是天然主场。
  • “日日新”是模型体系总称,旗下包含多个模型与应用。
  • 数字人视频生成与 AI 绘画是特色能力方向。

它是谁

日日新是商汤科技推出的大模型体系。商汤是国内最早一批以计算机视觉闻名的 AI 公司,图像分析等技术早已用在各行各业——可以理解为先学会了“看”,再学“说”。日日新这个名字取自“苟日新,日日新”,强调模型快速迭代。它更像一个模型家族的姓氏,旗下有语言模型、文生图模型、数字人模型等不同成员,统一在这个体系下持续升级。

能力特点

视觉是日日新的底盘:AI 绘画、图片理解是它的基本盘,技术积累也最深;更引人注目的是数字人与视频生成——输入文字或一张照片,就能生成开口说话的数字人视频,口型与表情基本同步,观感已经相当自然。

这类能力在新闻播报、知识讲解类短视频里已有大量应用。语言模型部分则覆盖对话、写作等常规任务,整体走多模态协同的路线,各个模型之间可以搭配着完成“写脚本、配画面、出视频”的流水线,创意工作者尤其受益。

怎么用 / 适合谁

需要批量生产讲解视频、口播内容的创作者和中小企业;对 AI 绘画感兴趣的普通用户;关注视觉 AI 技术落地的观察者。官网提供面向个人和企业的不同入口,部分功能也整合在其 App 中,按需选择即可。

局限与注意事项

数字人技术涉及肖像授权,用真人形象须本人同意,合成内容也应主动标明是 AI 生成;生成的视频在长镜头下仍可能出现表情僵硬、口型漂移。视觉能力强不等于语言推理同样强,复杂逻辑任务需另行验证。

常见问题

数字人会取代真人主播吗?

短期内更像是分工而非取代。标准化、重复性的播报内容,数字人性价比很高;但临场应变、情感共鸣、采访互动仍是真人的优势。目前行业的主流做法是让数字人处理模板化内容,真人去做更有创造性的部分。

本文为 AI 科普内容,仅用于知识普及,所引用的产品能力可能随版本更新而变化,不构成任何技术选型、投资或职业决策建议。