国产大模型新年动作频频:智谱联手华为开源新模型 MiniMax开源评测集

据了解,GLM-Image是首个在国产芯片上完成全流程训练的SOTA多模态模型,验证在国产全栈算力底座上训练高性能多模态生成模型的可行性。 不仅仅是智谱。超越。 对于近期的大模型热潮,百川智能创始人兼CEO、原搜狗CEO王小川当天在接受媒体采访时表示,“上市的两家(智谱、MiniMax)是....

  AI产业的迭代可谓日新月异,2026年甫一开始,国产开源大模型就进入了“上新潮”。

  1月14日,澎湃新闻记者获悉,最近上市的AI独角兽智谱(02513.HK)联合华为开源新一代图像生成模型GLM-Image,模型基于昇腾Atlas 800T A2设备和昇思MindSpore AI框架完成从数据到训练的全流程,是首个在国产芯片上完成全程训练的SOTA多模态模型。

  据智谱方面介绍,GLM-Image 采用自主创新的“自回归+扩散解码器”混合架构,实现图像生成与语言模型的联合,是智谱面向以Nano Banana Pro为代表的新一代“认知型生成”技术范式的一次重要探索。

  在架构特点方面,面对传统模型在“理解复杂指令”与“精准绘制文字”上难以兼顾的问题,GLM-Image引入“自回归+扩散解码器”混合架构,融合9B的自回归模型与7B的DiT扩散解码器。通过改进Tokenizer策略,GLM-Image能够自适应处理多种分辨率,原生支持从1024x1024到2048×2048尺寸的任意比例图像的生成任务,无需重新训练。

  值得注意的是,在上市后智谱股价持续迎来飙升,截至14日港股午盘,涨16.83%,其发行价定为116.2港元/股,这也意味着上市后智谱股价已经大涨超80%。

  在和华为合作方面,据智谱披露,依托昇腾NPU和昇思MindSpore AI框架,使用动态图多级流水下发、高性能融合算子、多流并行等特性,公司自研模型训练套件,全面优化数据预处理、预训练、SFT和RL的端到端流程。

  通过动态图的多级流水优化机制,将Host侧算子下发的关键阶段流水化并高度重叠,消除下发瓶颈;通过多流并行策略,通信和计算互掩,打破文本梯度同步、图像特征广播等操作的通信墙,使用AdamW EMA、COC、RMS Norm等昇腾亲和的高性能融合算子,同步提升训练的稳定性和性能。

  据了解,GLM-Image是首个在国产芯片上完成全流程训练的SOTA多模态模型,验证在国产全栈算力底座上训练高性能多模态生成模型的可行性。

  不仅仅是智谱。多家中国AI企业新年以来动作频频。同样在1月14日,澎湃新闻记者获悉,MiniMax正式开源首个面向Coding Agent的系统性评测集OctoCodingBench,试图为下一代AGI的落地标准给出更清晰的答案。评测结果显示,部分开源模型在过程合规指标上已快速逼近甚至超越部分闭源模型。

  1月12日,DeepSeek发布一篇新论文《Conditional Memory via Scalable Lookup:A New Axis of Sparsity for Large Language Models》(基于可扩展查找的条件记忆:大语言模型稀疏性的新维度),梁文锋位列作者名单中,这篇论文为北京大学和DeepSeek共同完成。据分析,这篇论文的核心直指当前大语言模型存在的记忆力“短板”,提出了“条件记忆”这一概念。

  行业普遍猜测,DeepSeek的下一代模型V4或将在今年春节前后正式发布。

  此外,爱诗科技发布最新视频模型PixVerse R1,是全球首个支持最高1080P分辨率通用实时世界模型,据介绍,这款新模型首次将视频生成的延迟从“秒级”降至“即时”响应,实现“所想即所见、所说即所现”的实时交互体验,标志AIGC领域的视频生成从“静态输出”迈入“实时交互”的全新阶段。PixVerse R1通过实现连贯且实时的生成,代表全世界范围内视听媒体领域的重要演进。

  1月13日,沉寂已久的另一家大模型独角兽“百川智能”宣布开源新一代医疗大模型 Baichuan—M3,其在全球最权威的医疗AI评测HealthBench中以65.1分的综合成绩位列全球第一;在专门考验复杂决策能力的HealthBench Hard上,以44.4分的成绩夺冠。这一成绩首次在医疗领域实现对GPT-5.2的超越。

  对于近期的大模型热潮,百川智能创始人兼CEO、原搜狗CEO王小川当天在接受媒体采访时表示,“上市的两家(智谱、MiniMax)是踩在了通用模型的技术红利和国家对于科技强国扶持的基础上,这方向是没有问题的,只是他们的市值和商业化能力并不匹配。”

  王小川表示,未来百川也会走到上市这条道路上,但并没有在进程中,他透露可能会在2027年启动上市计划。目前公司账上还有30亿元。

(来源:中国网)
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐

  • 美国大模型开打价格战

    表现达到Claude Fable 5.1水平,但运行成本较上一代Opus 5降低40%;输入和输出Token(词元)价格分别下降20%,缓存读取价格下降60%,生成速度提高超过30%。 价格打下来,两家公司并没有停止追求模型性能。Anthropic公布的测试数据显示,Opus 5.5在Terminal-Bench 4.0等编程测试中超....

    2026-09-25
  • 上半年生成式人工智能领域新设企业增长28.0%

    制造业企业转型升级步伐加快。装备制造业向高端迈进。上半年,高端装备制造业新设企业2.8万户,同比增长2.5%。其中,智能装备制造业增长6.4%,城市轨道装备制造业增长4.4%。高技术制造业增势强劲。截至6月底,高技术制造业企业总量达33.0万户,上半年新设1.5万户

    2026-08-10
  • Palantir CEO炮轰美国闭源大模型:企业花钱买Token,到头来却成为“训练素材”

    误区”,企业为了调用这些模型支付了高昂的费用,但这部分消耗并未转化为实际的业务价值,令企业客户在部署AI时面临严重的“信任危机”。 卡普:给闭源模型提供“训练素材” 卡普指出,企业CEO们正在担心“把时间和预算浪费在Token上,得不到任何价值,而且他们还会窃取我的知识产....

    2026-07-03
  • 美对大模型Mythos 5禁令折射AI时代网络安全新挑战

    天翼云科技有限公司安全产品线总经理助理吴雷注意到,传统安全关注的往往是系统是否被攻破,而AI安全关注的是模型是否被诱导、智能体是否被操控、数据是否被隐形地泄露了。“这就意味着攻击链条从漏洞利用转向了认知的一个操控,防御对象也从服务器应用扩展到服务器应用、模型、数....

    2026-06-30
  • 180万亿Token之后 豆包要算经济账

    就在前一天的火山引擎2026夏季FORCE原动力大会上,公司总裁谭待对外披露了一组数据:截至6月,豆包大模型日均Token调用量已突破180万亿,较去年增长超10倍。 尽管用户规模居于行业头部,但豆包并非业内首个试水C端付费的产品。百度旗下文心一

    2026-06-25
  • 豆包大模型2.1发布 Seedance2.5将于7月上线

    目前,Seedance 已在具身智能、工业制造、智能驾驶等领域落地,为数据合成、场景仿真、流程演示等业务需求提供新的工具能力。 此外,火山引擎还展示了豆包图像创作模型Seedream 5.0 Pro和豆包音频生成模型Seed-Audio 1.0,进一步巩固其多模态领先优势。 据介绍,Seedream 5.0 Pro....

    2026-06-23
  • 智谱等中国大模型何时达到Fable级别水平?马斯克:或许明年一季度

    马斯克第一次“点赞”中国大模型。 今年3月,AI编程平台Cursor推出Composer2和Composer2Fast两款编程模型专注于“长周期智能体编程”,被称为“目前最强编程模型”。不过,这两款模型发布后,有网友发现Composer2疑似使用月之暗面Kimi-K2.5模型,并在操作baseURL后发现相关线索。....

    2026-06-21
  • 微信智能体“打通”各大手机厂商?客服:将和华为、小米等厂商合作 相关功能陆续上线

    模型Hy2的10倍,尤其是代码和智能体类场景的Token调用量增加明显,并且腾讯的WorkBuddy/Codebuddy以及Qclaw类应用中的总增长幅度超过16.5倍。 AI赛道的竞争正在风起云涌,6月2日,记者了解到,字节跳动旗下大模型豆包预计将在6月下旬正式上线付费内容,若进展顺利,豆包将于三季度....

    2026-06-05
  • 国家发改委:指导国产大模型加大力度适配国产算力芯片

    国家发展改革委政策研究室副主任、新闻发言人李超在新闻发布会上表示,人工智能领域核心技术和应用需求都呈现快速增长态势,我们始终坚持系统布局、分业施策、开放共享、安全可控,推动人工智能与经济社会各行业各领域广泛深度融合,指导国产大模型加大力度适配国产算力芯片,在保....

    2026-05-23
  • 中国大模型调用量登顶如何重塑全球AI产业格局?

    ”  这一增长,将强化中国大模型全产业链“应用驱动创新”的良性闭环。对云服务商而言,刘杰告诉记者,Token出海带来了对海外节点算力、网络加速、安全防护等服务的大量需求。中国Token出海,还将推动全球大模型生态向多元共生持续演变。

    2026-03-29