OpenAI发布了GPT-5.6 Sol的Ultrafast新API服务层,声称输出速度可达标准层的14倍,峰值750 tokens/秒。该服务基于Cerebras专用AI硬件,显著提升了大模型推理的吞吐能力。

OpenAI发布内容

Ultrafast模式作为GPT-5.6 Sol的预览API层,官方称其输出速度相比标准层提升14倍,单请求峰值可达750 tokens/秒。底层由Cerebras硬件支持。

证据与机制

OpenAI官方公告明确了技术基础(Cerebras硬件)及性能指标。Ultrafast定位于解决LLM推理速度瓶颈,适用于实时分析、对话代理或大批量处理等场景。

对独立开发者的影响

对于个人开发者和小团队,该服务有望解锁如实时文档摘要、即时代码生成等此前受限于延迟的产品形态,也可缩短批处理任务的执行窗口,降低基础设施成本。

实用建议

如当前工作流受限于LLM输出速度,可尝试Ultrafast模式。但实际性能仍取决于具体任务和API限制。定价及更广泛可用性尚未公布,正式集成前建议持续关注后续信息。