东吴证券发布研报称,LLM、VLM、VLA可理解为同一技术脉络上逐层扩展模态和输出能力的三类大模型,从文本到
LLM以文本为输入输出,主要解决语言理解、生成和推理;VLM在语言底座上加入
LLM由Transformer、GPT等奠定,核心是以海量文本和自监督训练形成语言基础模型;VLM由CLIP、Flamingo等推动,通过图文对齐、
LLM训练依赖文本语料,VLM增加图文对和
LLM主要处理知识、代码、对话和软件任务;VLM把能力扩展到图像理解、图文问答、
该行认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但难以实现物理世界的建模闭环;物理AI将成为物理世界的AI解决方案,从而在AI当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,应重点关注。
技术迭代不及预期风险;大模型厂商ARR增速放缓风险;云服务商资本开支不及预期风险;智能驾驶及机器人商业化落地不及预期风险。










