介绍阶跃星辰公司的 Step 系列多模态大模型:团队有深厚的视觉技术背景,图像理解与生成、语音对话是重点方向,普通用户可通过“跃问”App 体验拍照问答与图像创作的入门科普。

关键信息

  • 研发方:阶跃星辰(中国)
  • 所属阵营:国内
  • 阅读难度:入门
  • 预计阅读:约 5 分钟

核心要点

  • 创始团队有深厚的多模态技术背景,视觉方向见长。
  • Step 系列覆盖理解与生成,图像和语音能力是重点。
  • 消费级入口是“跃问”App,日常问答与图像玩法兼具。

它是谁

阶跃星辰是一家上海的大模型创业公司,创始团队此前的技术经历集中在计算机视觉领域——也就是教机器“看”的学问。这份基因决定了 Step 系列的取向:不只把语言模型做好,还早早押注多模态,让模型既能看懂图片,也能生成图片、听懂声音。面向普通用户的产品叫“跃问”,一个可以日常聊天也能玩图像创作的应用。

能力特点

多模态是 Step 的招牌:拍照问问题、识别图中文字和物体、根据描述生成插画,都在它的能力清单里;语音方向也布局了类似实时通话的对话方式,对着手机说话就像和另一个人煲电话粥一样自然。

相比“什么都会一点”的通用路线,它更像是把“看与听”这一横做深,再逐步向推理等其他能力扩展。这种打法让它在图片相关的具体任务上常有不错的完成度,识图和画图两类需求都可以交给它试试。

怎么用 / 适合谁

适合喜欢视觉玩法的用户:拍照识物、修图配文、生成头像插画;有语音交流偏好的用户;以及关注多模态技术走向的观察者。跃问 App 上手简单,适合轻度尝鲜,网页版也可以直接使用,两边功能大同小异。

局限与注意事项

多模态生成对细节的把控仍在进步中,人物的手、图里的文字等细节容易出错;图像理解对专业领域图表的识别未必准确,医学影像这类严肃内容更不能只信它。产品功能与免费额度可能随版本变动,重要用途先做小范围验证。

常见问题

“多模态”到底是什么意思?

模态指信息的形态:文字是一种,图片、声音、视频各自是一种。“多模态”就是模型不只会处理文字,还能看图、听声、看视频。就像人读书看报之外还会看照片、听广播——模型也在从“只识字”进化到“有眼睛有耳朵”。

本文为 AI 科普内容,仅用于知识普及,所引用的产品能力可能随版本更新而变化,不构成任何技术选型、投资或职业决策建议。