智元发布全国首个通用具身基座模型ViLLA
2025年3月10日,国内人工智能领军企业智元科技在北京国家会议中心正式发布了“智元启元大模型(Genie Operator-1)”,标志着我国在通用人工智能领域取得了重大技术跃迁。这也是全国首个通用具身基座模型,被称为ViLLA。
智元启元大模型采用了突破性的Vision-Language-Latent-Action(ViLLA)架构,该架构由多模态大模型(VLM)和混合专家(MoE)组成。这种三层异构神经网络架构实现了多模态深度融合,通过动态注意力机制处理环境信息,集成多轮对话上下文记忆,以及独创的Latent Action空间将抽象指令转化为可执行的动作序列。
在测试中,智元启元大模型展现了强大的跨场景任务迁移能力。面对复杂指令,如“整理杂乱书桌”,系统能自主规划路径、识别物品类别并完成精准抓取摆放,全程无需人工干预。在五种不同复杂度任务的测试中,该模型相比已有的最优模型,任务成功率平均提高了32%。
此外,基于启元基座开发的具身智能终端已进入规模化测试阶段,并在工业质检、智能家居和医疗护理等多个领域展现出广阔的应用前景。例如,在工业质检领域,搭载该模型的机械臂可将零件缺陷识别准确率提升至99.7%,同时将操作效率提高3倍。
智元科技表示,将持续投入研发资金,推出支持多国语言、适配主流硬件的开发者套件,与合作伙伴共建具身智能产业生态。
