信源:X:karminski (@karminski3) · 👁️ 49381 次研读

阶跃 Step-5-Preview 实测:输出稳定、Agent Loop 强

💡 灵机 AI 深度洞见与核心提炼
阶跃 Step-5-Preview 实测显示输出稳定性突出,后训练扎实,写工程代码很少反复;在"硅基交警"Agent 测试中全程未指挥出事故,后端 Agentic Coding 与"硅基骑手"多轮测试得分 Δ 很小。其 Agent Loop 迭代能力可卡着极限数值优化,例如把送餐超时理解为送餐时间+5分钟以多赚积分。短板是前端、3D 场景与美学,较上一代有提升但距本代 SOTA 仍有差距。
信源媒体:X:karminski (@karminski3)
访问出处网页 ↗
阅读原文出处 ↗