AI推理

搜索文档
华为:AI推理创新技术UCM将于今年9月正式开源
新浪科技· 2025-08-12 11:21
产品发布 - 华为发布AI推理创新技术UCM推理记忆数据管理器 包括推理引擎插件Connector 功能库Accelerator 高性能KV Cache存取适配器Adapter三大组件 [2] - UCM技术通过推理框架 算力 存储三层协同 实现AI推理更优体验和更低成本 [2] 技术应用 - 华为与中国银联在金融典型场景开展UCM技术试点应用 联合发布智慧金融AI推理加速方案应用成果 [2] - 在中国银联客户之声业务场景下 UCM技术使大模型推理速度提升125倍 仅需10秒即可精准识别客户高频问题 [3] 行业观点 - AI时代模型训练和推理效率的量纲以Token数为表征 Token经济已经到来 [2] - 企业需持续加大算力投入保障推理体验 但需在推理效率与成本之间找到最佳平衡点 [2] 生态发展 - 华为公布UCM开源计划 通过开放统一南北向接口适配多类型推理引擎框架 算力及存储系统 [3] - UCM将于今年9月正式开源 后续逐步贡献给业界主流推理引擎社区 [3] - 中国银联将联合华为等生态伙伴共建AI+金融示范应用 推动技术成果从实验室验证走向规模化应用 [3]
华为发布AI推理创新技术
半导体芯闻· 2025-08-12 09:48
AI推理技术创新 - 华为联合中国银联发布AI推理创新技术UCM(推理记忆数据管理器),旨在实现高吞吐、低时延的推理体验 [2] - UCM技术以KV Cache为中心,融合多类型缓存加速算法工具,分级管理推理记忆数据,扩大推理上下文窗口,降低每Token推理成本 [3] AI推理行业趋势 - AI正从训练向推理结构性转变,推理体验成为AI应用的关键,包括时延、准确度和复杂上下文推理能力 [2] - 国外主流模型单用户输出速度达200 Tokens/s(时延5ms),而国内普遍小于60 Tokens/s(时延50-100ms),提升推理效率迫在眉睫 [2] 其他行业动态 - 半导体行业投资规模达10万亿 [4] - 芯片巨头市值出现大幅下跌 [4] - 黄仁勋评价HBM为技术奇迹,Jim Keller认为RISC-V将胜出 [4]
华为发布AI推理“黑科技” 助力解决AI推理效率与用户体验难题
中国基金报· 2025-08-12 07:50
8月12日下午,华为正式发布AI推理"黑科技"UCM(推理记忆数据管理器),助力解决AI推理效率与用 户体验的难题。 AI推理是AI产业在下一阶段的发展重心。AI产业已从"追求模型能力极限"转向"追求推理体验最优化", 推理体验直接关联用户满意度、商业可行性等核心需求,成为衡量AI模型价值的黄金标尺。 KV Cache是一种用于优化计算效率、减少重复运算的关键技术,但是需要占用GPU(图形处理器)的 显存存储历史KV(键值)向量,生成的文本越长,缓存的数据量越大。 来源:中国基金报记者拍摄 来源:中国基金报记者拍摄 随着AI产业的发展迈入代理式人工智能时代,模型规模化扩张、长序列需求激增,以及推理任务并发 量增长,导致AI推理的KV Cache容量增长,超出了显存的承载能力。 目前,国外领先芯片厂商通过从硬件迭代到软件优化,再到生态绑定,构建起AI推理时代的"铁三角", 短期内难以被代替。中国企业在单点硬件技术上有所突破,但国产软件及生态适配仍有较大差距。 随着信息技术应用创新产业的国产化改造提速,各行业逐步意识到需要加速构建国产推理生态。UCM 的核心价值在于提供更快的推理响应、更长的推理序列等。 以提供更 ...
AI重磅!华为“黑科技”来了
中国基金报· 2025-08-12 07:40
行业趋势与背景 - AI产业从追求模型能力极限转向追求推理体验最优化 推理体验成为衡量AI模型价值的黄金标尺[1] - AI推理是AI产业下一阶段发展重心 直接关联用户满意度和商业可行性[1] - 模型规模化扩张、长序列需求激增及推理任务并发量增长导致KV Cache容量超出显存承载能力[2] - 国外领先芯片厂商通过硬件迭代、软件优化和生态绑定构建AI推理时代"铁三角" 中国企业单点硬件有突破但软件及生态适配仍有较大差距[2] - 信息技术应用创新产业国产化改造提速 各行业加速构建国产推理生态[2] 技术方案与性能 - UCM是以KV Cache为中心的推理加速套件 融合多类型缓存加速算法工具 分级管理推理记忆数据[2] - 通过动态KV逐层卸载和位置编码扩展技术 将超长序列Cache分层卸载至外置专业存储 实现10倍级推理上下文窗口扩展[3] - 根据记忆热度在HBM、DRAM、SSD等存储介质中实现按需流动 融合稀疏注意力算法实现存算深度协同[4] - 长序列场景下TPS提升2至22倍 降低每个Token的推理成本[4] - 支持用户输入超过17万Tokens的超长序列推理 解决超长序列模型推不动的问题[5] 性能对比与行业影响 - 国外主流AI大模型单用户输出速度达200 Tokens/s(时延5ms) 中国主流模型普遍小于60 Tokens/s(时延50-100ms)[4] - AI应用向实际场景深度渗透 用户规模和请求量急剧攀升 模型分析和生成Token数呈指数级增长[4] - Token处理量增长导致服务器维护和电力消耗等运营成本持续攀升 保障流畅推理体验需加大算力投入[4] - Token经济时代来临 训练和推理效率与体验量纲都以Token为表征[5] 商业化应用 - 华为AI推理加速方案结合UCM与OceanStor A系列存储技术 与中国银联开展智慧金融AI推理加速应用试点[5] - 三大落地业务场景包括客户之声、营销策划和办公助手[5] - 华为计划9月在魔擎社区开源UCM 后续逐步贡献给主流推理引擎社区 共享给所有Share Everything存储厂商和生态伙伴[1]
AI重磅!华为“黑科技”来了
中国基金报· 2025-08-12 07:37
华为AI推理技术UCM发布 - 华为正式发布AI推理"黑科技"UCM(推理记忆数据管理器),旨在解决AI推理效率与用户体验难题 [2] - UCM是一款以KV Cache为中心的推理加速套件,融合多类型缓存加速算法工具,可分级管理推理过程中产生的KV Cache记忆数据 [7] - UCM通过动态KV逐层卸载、位置编码扩展等组合技术,实现10倍级推理上下文窗口扩展 [8] AI推理行业发展趋势 - AI产业已从"追求模型能力极限"转向"追求推理体验最优化",推理体验成为衡量AI模型价值的关键指标 [4] - 随着AI应用向各类实际场景深度渗透,用户规模和请求量急剧攀升,模型分析和生成的Token数呈现指数级增长态势 [11] - 国外主流AI大模型的单用户输出速度已进入200 Tokens/s区间(时延5ms),而我国主流AI大模型的单用户输出速度普遍小于60 Tokens/s(时延50至100ms) [11] UCM技术优势 - UCM可根据记忆热度在HBM、DRAM、SSD等存储介质中实现按需流动,融合多种稀疏注意力算法实现存算深度协同 [11] - 在长序列场景下,UCM可使TPS(每秒处理token数)提升2至22倍,从而降低每个Token的推理成本 [11] - UCM支持用户输入超过17万Tokens的超长序列推理,避免超长序列模型推不动的问题 [15] 商业化应用进展 - 华为计划在9月开源UCM,将在魔擎社区首发,后续逐步贡献给业界主流推理引擎社区 [5] - 华为AI推理加速方案结合UCM与华为AI存储技术,与中国银联开展智慧金融AI推理加速应用试点 [12] - 三大落地业务场景分别是客户之声、营销策划、办公助手 [12]
华为发布AI推理创新技术UCM:实现高吞吐、低时延推理体验,降低每Token推理成本
新浪科技· 2025-08-12 07:22
据介绍,华为此次发布的AI推理创新技术UCM(推理记忆数据管理器),作为一款以KV Cache为中心 的推理加速套件,其融合了多类型缓存加速算法工具,分级管理推理过程中产生的KV Cache记忆数 据,扩大推理上下文窗口,以实现高吞吐、低时延的推理体验,降低每Token推理成本。 责任编辑:郭栩彤 新浪科技讯 8月12日下午消息,在2025金融AI推理应用落地与发展论坛上,华为联合中国银联共同发布 AI推理创新技术UCM(推理记忆数据管理器),实现高吞吐、低时延的推理体验。 在当今数字化时代,AI发展日新月异。大模型训练的热潮尚未消退,AI推理体验却已悄然成为AI应用 的关键。中信建投在2025WAIC期间发布的白皮书指出,AI正从训练向推理的结构性转变而快速增长。 在这样的大背景下,AI推理体验的重要性愈发凸显。 推理体验直接关系到用户与AI交互时的感受,包括回答问题的时延、答案的准确度以及复杂上下文的 推理能力等方面。资料显示,国外主流模型的单用户输出速度已进入200 Tokens/s区间(时延5ms),而 我国普遍小于60Tokens/s(时延50 - 100ms),如何解决推理效率与用户体验的难题迫在 ...
张忆东:震荡是港股长期行情的蓄电池!恒生科技ETF基金(513260)、港股通科技ETF汇添富(520980)连续回调“吸金”!
新浪财经· 2025-08-12 06:57
港股市场表现 - 港股集体下跌 恒生科技ETF基金跌0.43% 近10日净流入资金6.4亿元 基金规模达53.63亿元 [1] - 恒生科技ETF基金融资余额1.3亿元 单日融资买入额3957万元 [1] - 港股通科技30ETF跌0.99% 单日成交额3.13亿元 近20日资金流入8.6亿元 [1] 科技板块个股表现 - 华虹半导体涨超4% 中芯国际涨超3% 比亚迪电子涨超2% 小米集团微涨 [4] - 快手跌超8% 阿里巴巴跌超1% 腾讯控股跌0.71% 美团微跌0.42% [4][5] - 网易涨0.99% 京东集团持平 小鹏汽车跌2.63% [5] 机构观点与市场预期 - 兴业证券坚定看多港股 认为将走出超级大行情 港股PE低于历史1/4分位数 [6] - 招商证券判断港股进入震荡阶段 恒指PE仅11.1倍 显著低于标普500的26.7倍 [8] - 科技板块存在补涨需求 恒生科技指数PE不足纳斯达克50% [9] 资金流向与市场动态 - 南向资金持续流入港股市场 聚焦科技板块机会 [7] - 54.1%港股公司发布盈喜 金融/原材料/科技/消费行业盈喜比例较高 [6] - 华为将发布AI推理突破性技术 或降低对HBM技术依赖 [5] 行业与政策环境 - 港股投资逻辑转向"在岸市场化" 成长溢价成为新赚钱模式 [6] - 科技产业资本开支将转化为企业盈利 AI产业链拉动作用明显 [8][9] - "反内卷"政策效果逐步显现 经济有望走出通缩周期 [8]
华为发布AI推理创新技术UCM
证券时报网· 2025-08-12 06:55
人民财讯8月12日电,8月12日,华为正式发布AI推理创新技术UCM(推理记忆数据管理器)。据了解,作 为一款以KV Cache为中心的推理加速套件,UCM融合了多类型缓存加速算法工具,分级管理推理过程 中产生的KV Cache记忆数据,可扩大推理上下文窗口,实现高吞吐、低时延的推理体验,降低每Token 推理成本。该技术已率先在中国银联"客户之声""营销策划""办公助手"三大业务场景中,开展智慧金融 AI推理加速应用试点,并已取得成果。 ...
华为即将发布AI推理领域突破性黑科技;供需失衡,第三季DDR4合约价或季增85%-90%——《投资早参》
每日经济新闻· 2025-08-12 01:01
美股市场表现 - 美股三大指数小幅收跌 道指跌0.45% 纳指跌0.3% 标普500指数跌0.25% [1] - 大型科技股多数下跌 英特尔跌超3% 特斯拉涨超2% 房利美涨超15% 房地美涨逾13% 均创2008年以来收盘新高 [1] - 中概股多数下跌 纳斯达克中国金龙指数跌0.29% 好未来跌逾3% 理想汽车跌近3% 百度、阿里巴巴跌超1% [1] 商品及欧洲市场 - COMEX黄金期货跌2.80%报3393.7美元/盎司 COMEX白银期货跌2.33% [1] - 国际油价小幅上涨 美油主力合约涨0.19%报64.00美元/桶 布伦特原油主力合约涨0.15%报66.69美元/桶 [1] - 欧洲三大股指涨跌不一 德国DAX指数跌0.34% 法国CAC40指数跌0.57% 英国富时100指数涨0.37% [1] 华为AI技术突破 - 华为发布AI推理加速技术 降低中国AI推理对HBM技术依赖 提升国内AI大模型推理性能 [2] - CANN全面开源开放 支持用户自主深度挖潜和自定义开发 可对标英伟达CUDA [2] - 概念股包括东方国信、软通动力、云从科技等 [2] 内存市场供需 - 2025年下半年DDR4市场持续供不应求 价格强势上涨 服务器订单挤压电脑和终端市场供应 [3] - 7月ConsumerDDR4合约价飙涨60%-85% 第三季合约价上修至季增85%-90% [3] - 第三季LPDDR4X合约价涨幅扩大至季增38%-43% 因美韩系厂商2025-2026年减少或停止供应DDR4X [4] 存储产业受益 - 内存原厂有意扩大售价涨幅 DDR4仍将供不应求 推动各类存储原厂端供应价格上行 [4] - 国内存储长期受益 概念股包括同有科技、朗科科技、兆易创新等 [4] 具身智能机器人政策 - 杭州市促进具身智能机器人产业发展 建立多元智算供给服务体系 降低算力使用成本 [4] - 聚焦具身智能"大脑"、"小脑"及"本体"三大核心环节 支持研发平台建设和运营 [4] 人形机器人产业前景 - 2025年有望成为人形机器人从0到1阶段关键时点 行业头部公司加速推进零部件性能升级和成本降低 [5] - 具身智能市场规模加速打开 预计2026年突破万亿规模 概念股包括东土科技、汉宇集团、汉威科技等 [6] 股东减持动态 - 奥康国际股东项今羽拟减持不超过1200万股 占总股本3% [7] - 天孚通信股东询价转让价格为88.55元/股 受让方为14名机构投资者 拟受让990万股 [7] - 奇德新材实控人饶德生拟减持不超过167.91万股 占总股本2% [7] 继续股东减持 - 天合光能股东有则创投拟减持1247.49万股 占总股本0.57% 为实控人一致行动人 [7] - 诺邦股份金诺创及任建永拟合计减持不超过155.7万股 占总股本0.88% 为控股股东一致行动人 [7] - 南亚新材实控人包秀银拟减持不超过373.6万股 占总股本1.59% 监事金建中拟减持27万股 占总股本0.12% [8] 银行股减持交易 - 飞鹿股份股东何晓锋拟减持不超过303.37万股 占总股本1.48% 股东刘雄鹰拟减持不超过337.76万股 占总股本1.65% [8] - 重庆银行股东重庆水投拟减持不超过5200万股A股 占总股本1.5% 持股比例由8.5%降至7% [8] - 重庆市地产集团收购上述股份 交易金额不高于5.8亿元 获重庆市国资委批复同意 [8]
沪指再创年内新高,A股超4200只股票上涨,锂矿股大爆发
每日经济新闻· 2025-08-11 08:16
市场整体表现 - 市场全天震荡走高,创业板指领涨1.96%,沪指涨0.34%,深成指涨1.46%,盘中均创年内新高 [1] - A股全天成交额1.85万亿元,较上个交易日放量1136.68亿元,全市场超4200只股票上涨,逾百股涨超9% [1] - 港股横盘震荡,恒生指数涨0.01%,恒生科技指数跌0.23%,南向资金净卖出超14亿港元 [8] 板块表现 - PEEK材料概念股爆发涨幅7.54%,中欣氟材5天4板 [3][4] - 锂矿板块大涨5.24%,盛新锂能等多股涨停,赣锋锂业港股涨超20%,天齐锂业涨超17% [3][4][9] - 算力硬件股走强,胜宏科技创历史新高,高新发展涨停 [3][6] - 跌幅居前板块包括银行跌1.03%、黄金珠宝跌1.93%、煤炭开采跌0.34% [3][4] 重要事件驱动 - 宁德时代宜春项目采矿证到期暂停开采,碳酸锂期货主力合约涨停8%报81000元/吨 [5] - 江西锂矿停产可能影响每月7000-8000吨碳酸锂当量,瓷土矿转锂土矿税率提高成本 [5] - 华为将于8月12日发布AI推理突破性技术,可能降低对HBM技术依赖 [6] 机构观点 - 中信建投认为A股处于牛市中继,建议关注AI算力、半导体、人形机器人、有色等新赛道低位品种 [7] - 财通证券与天风证券均认为碳酸锂供给收缩预期加剧,或迎来价值重估 [5]