中科院全模态大模型,文本语音图像视频信号3D点云全面理解
紫东太初是中科院自动化研究所的大模型项目,跟 GPT 走的技术路线不同——它强调的是「全模态」而非单纯的文本规模。能同时处理文字、语音、图像、视频、3D 点云和传感器信号。它的应用场景偏向工业和研究:比如机器人同时处理视觉和触觉信息、工业质检结合图像和传感器数据。开源可用,适合学术研究和垂直行业应用。
https://imagen.research.goo...
快手AI视频生成模型。
大模型实验室 — 来自AI模型下载分类的实用 AI 工具推荐
集成了OpenAI、Ollama、DeepSeek等多模型的现代AI聊天应用,Markdown渲染和截图功能齐备
DeepCoder 开源代码推理模型
上海人工智能实验室打造的全模态理解大模型,支持文本语音图像视频信号等