Multimodal多模态

模型能同时理解和生成多种类型的内容——文本、图片、音频、视频。

模型能同时理解和生成多种类型的内容——文本、图片、音频、视频。GPT-4o、Gemini 都是多模态模型。对产品经理来说,多模态意味着交互方式的根本变革:用户可以拍照提问、语音指令、上传视频让AI分析。

什么时候会用到

讨论产品形态创新、交互设计、竞品分析时会用。

例句

  • 下个版本要支持多模态,用户拍张照片就能识别商品并给出搭配建议。
  • 竞品已经支持语音+图片输入了,我们还只能打字,得跟上。