联想天禧自研代码智能体TianxiCode斩获SWE-bench-Live全球第一 – 量子位
Quick Answer
Lenovo's TianxiCode achieved a 71% problem-solving rate, ranking first globally in the SWE-bench-Live benchmark, showcasing its advanced capabilities in software engineering.
Quick Take
This AI framework, developed by Lenovo Tianxi, demonstrates significant potential for real-world application in code generation and engineering development.
Key Points
- TianxiCode achieved a 71% problem-solving rate, topping the -Live benchmark.
- The framework passed official verification, confirming its reproducibility and high value.
- TianxiCode features multi-hop retrieval and autonomous planning for efficient problem-solving.
- It integrates closed-loop patching and test-driven self-correction for robust performance.
- Lenovo aims to embed TianxiCode into its AI hardware products for enhanced developer support.
📖 Reader Mode
~2 min read< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
2026-10-09 16:53:08 来源:量子位
联想天禧AI自主研发的专业代码智能体框架TianxiCode 以71%的问题解决率登顶全球第一名
近日,在国际公认难度最高、最贴近真实开发环境的软件工程评测SWE-bench-Live(Lite分榜)中,由联想天禧AI自主研发的专业代码智能体框架TianxiCode配合DeepSeek-v4.1-Flash取得突破性成绩:以71%的问题解决率登顶全球第一名,并正式通过官方审核。

这一成绩不仅标志着联想自研代码智能体框架迈入国际第一梯队,更展现出天禧AI生态以自研工程架构驱动模型潜能、在复杂软件工程竞技场抗衡全球顶尖方案的硬核实力。Tianxi Code 是联想天禧AI聚焦代码生成、工程开发的代码智能子能力,未来将应用到联想 AI 硬件产品中。
服务真实场景,SWE-bench-Live的含金量有多少?
不同于考查简单语法或单函数生成的传统代码测试,SWE-bench-Live是当前全球软件工程领域的权威性动态评测基准。
SWE-bench-Live以真实GitHub项目中的问题为基础,评估模型与智能体生成代码补丁、修复问题的能力,并提供可复现的执行环境。相较于单纯考查代码片段生成,这类评测更贴近真实开发中的问题处理过程,对系统理解代码、定位问题和完成修复提出了综合要求。
为了确保评测的绝对公正,SWE-bench-Live官方设立了“Verified”核验机制。参评方案必须提交全链路的智能体运行轨迹(Trajectories),由官方团队严格审查评测输入、信息隔离环境,并彻底排查是否存在向智能体泄露标准答案、测试用例或结果的可能。TianxiCode与DeepSeek-v4.1-Flash成功通过审查并斩获“Verified”认证,充分证明了其代码修复成绩的可复现性与高含金量。
TianxiCode架构突破,释放工程级落地能力
如果把“TianxiCode配合DeepSeek-v4.1-Flash”整个系统比作一个软件工程师。那么DeepSeek-v4.1-Flash是工程师的大脑,负责阅读代码、理解语义、构思解法;而TianxiCode则是工程师的眼、手、工具箱以及工作流规范。再聪明的大脑,离开了一双能敲代码、查日志的“手”和的严谨工作习惯,也无法在复杂的现实工程中独自解决 Bug。
多项榜单对比数据印证了这一点:若缺乏顶层智能体架构的系统协同,即便调用顶级闭源模型,面对真实工程难题也常常束手无策。而这些足以见证TianxiCode的技术含金量。
在实际软件工程场景下,TianxiCode展现出跨文件多跳检索与精准上下文管理、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大系统工程能力。
跨文件多跳检索(Multi-Hop Retrieval)与精准上下文管理(Context Pruning & Slicing)让TianxiCode能够像资深工程师一样“顺藤摸瓜”寻找问题,在大型代码库中快速定位缺陷根因。
自驱动规划(Autonomous Planning)与多轮工具调用(Multi-turn Tool Calling)赋予TianxiCode像真人程序员一样“边看边敲”:遇到Bug会先列出排错计划,主动打开终端命令行去运行测试、翻阅日志、比对修改记录。遇到解决不了的问题,它还会灵活换个思路继续排查,实现自主推进。
闭环补丁生成(Closed-Loop Patching)与测试驱动自愈(Test-Driven Self-Correction)可以让TianxiCode能够自测自纠。TianxiCode会自动在隔离环境中运行代码,一旦发现新代码报错或破坏了其他功能,就立刻进行自我反思与修改,直至补丁通过项目验收。
可以说,TianxiCode扎实的自研工程底座展示了复杂的现实软件研发场景下,强大的智能体框架带来的决定性力量。
从榜单前列走向产业深处,天禧生态加速AI普惠
作为天禧AI生态在专业技术领域的关键研发布局,TianxiCode此次在国际顶级评测中跻身第一梯队,不仅是一次技术实力的集中验证,更为智能体在真实研发场景的落地铺平了道路。
代码智能体的最终价值,不在于单一榜单的排名,而在于为一线开发者分担繁重的排错与工程协同成本。未来,联想天禧AI将持续推动TianxiCode的技术成果向开发者实际工具链沉淀,依托成熟的自主智能体架构,让安全、高效、真正具备自主问题解决能力的专业代码工具,深度赋能到联想的硬件设备中。
本文由联想提供,量子位获授权转载,观点归原作者所有。
版权所有,未经授权不得以任何形式转载及使用,违者必究。
— Originally published at qbitai.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from WebSearch (Tavily)
See more →全球AI芯片峰会,9月上海见!
The 2026 Global AI Chip Summit will take place in Shanghai on September 22-23, focusing on the evolving AI chip landscape, including the shift from training to inference, the rise of diverse chip technologies, and the restructuring of industry competition. Notable speakers include experts from leading universities and companies, discussing advancements in AI chip architecture and applications.