7月9日,苹果公司正接洽加州理工衍生AI初创PrismML,评估其1-bit模型压缩技术在iPhone上的应用。该技术可将大模型体积压缩至原版约1/14,内存占用降低超90%,并在iPhone 17 Pro上成功运行精简版Qwen 3.6(27B参数)。PrismML采用原生{-1,+1}权重表示与分组缩放因子,无需高精度回退,推理速度最高提升8倍,能耗降低75%-80%。苹果意在提升设备端AI推理性能,强化本地大模型部署能力。