概率
分类
预测
概率
ME-Decoding将候选token看作待剪枝的集成成员:既关注单个候选的概率,也考察它与其他候选的语义关系。
文章
ME-Decoding的核心是:筛选候选token时,既考虑单个候选的概率,也考虑候选之间的语义冗余,从集合层面决定保留哪些候选。
文章
MEE将候选概率与语义关系纳入同一个集合评分:概率反映模型对候选的置信度,相似度矩阵则反应候选之间的语义关系。
文章
方法同时读取模型概率和tokenembedding,在每个生成步骤中寻找置信度较高、内部冗余较低的samplingsupport。
文章
讲话之后,芝加哥商品交易所(CME)美联储观察工具显示的9月加息概率从34%推升至60%左右。
文章
我们认为,由于美国劳动力市场已接近充分就业、中东战事反复推动能源价格重新上行、人工智能(AI)投资热潮延续等因素导致美国通胀风险偏向上行,因此后续美联储继续加息的概率不低,但加息空间与节奏仍然受多重因素约束,未来利率政策路径存在较大不确定性。
文章
大学毕业生从事新工作的概率比高中毕业生高2.9个百分点。
文章
进入新工作领域似乎有持续效应:1940年从事新工作的人,到1950年仍在做新工作的概率是普通人群的2.5倍。
文章
校准
追求概率校准:不只要选对,还要让给出的概率反映真实正确率
文章
这也是Jev式接口的价值所在——当概率直接进入代码逻辑并决定任务走向时,概率校准就从一个单纯的学术指标,变成了整个系统是否可靠的基石。
文章
方法
论文分别匹配概率方法与ME-Decoding的平均支持集大小、剪枝后熵和支持集内两两余弦相似度,比较这些条件近似一致时的推理表现与集合评分。
文章
截断
为了避免采样到极小概率token,Top-p、Min-p等常用方法根据概率截断候选集合,再从剩余部分进行采样。
文章
尤其在GSM8K的高温设置下,部分概率截断方法出现明显退化,而ME-Decoding仍保持较高准确率,体现了跨模型、跨温度的推理稳健性。
文章
左侧:概率截断仅依据单个token的概率决定去留。
文章
端到端GPU测试中,相对基于概率截断的最快基线的总延迟仅增加约
文章
端到端GPU测试中,相比最快的概率截断基线,总延迟仅增加约3%。
文章
分布
ME-Decoding提供了不同于传统截断的视角:LLM解码除了在概率分布上划定阈值,还可以被理解为动态的集合优化问题。
文章
为了提升解码多样性,现有方法往往不采取贪心选择的策略而是从概率分布中采样来得到下一步预测。
文章
这一过程无需预先固定保留的token数量,而是根据每一步的概率分布与语义关系自动确定集合大小。
文章
候选
MES在保留高概率候选的同时,调整已被当前集合覆盖的语义方向的贡献,以获得更紧凑、更有信息量的samplingsupport。
文章
在一次解码步骤中,大语言模型面对的并不是唯一答案,而是一组具有不同概率的候选token。
文章
效果
这一结果支持其优势来自MES对概率与语义冗余的联合评估,而非仅仅缩小支持集、降低采样熵或降低平均余弦相似度。
文章
端到端GPU测试中,相对基于概率截断的最快基线的总延迟仅增加约
文章
端到端GPU测试中,相比最快的概率截断基线,总延迟仅增加约3%。
文章