TOPIC HUB
Agent工作流
聚合Agent、AI编程、Claude Code、Cursor、工作流自动化等内容,帮助你把智能体能力落到真实任务链路。
最新收录:Nvidia 的 SoL-Pi 系统通过优化 harness 将近乎一半的编码 agent token 用量削减
TOPIC GUIDE
Agent工作流导读
Agent工作流专题聚焦智能体从演示走向实用的过程:任务拆解、工具调用、上下文管理、验收标准和人机协作。
真正有价值的Agent不是一次性聊天,而是能在明确边界内稳定完成重复任务,并把结果交给人类判断。
这个专题适合工程、运营、内容和个人效率场景,用来搭建自己的智能体任务系统。
READING PATH
建议阅读路径
先确定任务边界
把目标、输入、输出和验收标准写清楚,避免智能体自由发挥。
再接入工具链
观察它如何使用浏览器、代码、文档、数据和自动化工具。
最后加反馈回路
用日志、检查清单和人工复核,让工作流可以持续改进。
SELECTED FILES
Agent工作流精选内容
Nvidia 的 SoL-Pi 系统通过优化 harness 将近乎一半的编码 agent token 用量削减
Nvidia 论文提出 SoL-Pi,自动优化编码 agent 的控制层 harness。在 EdgeBench 上,token 用量下降 44.7% 到 49%,性能大致持平;按当前 API 价格估算,每小时可节省 4.36 到 13.50 美元。
Arena:GPT-6 Sol(Max)以 +7.7% 净改进重塑 Agent Arena Pareto 前沿
Arena 宣布 OpenAI 的 GPT-6 Sol(Max)进入 Agent Arena,基于 4K+ 真实智能体会话取得 +7.7% 净改进,排名第 6,中位成本 $0.75/task。榜单同时给出得分与成本两个维度,读者可据此判断该模型在性价比坐标上的位置。
趋势解读:Meta's Muse agent gives every user a full,解读最新 AI 进展
趋势解读:Meta's Muse agent gives every user a full,解读最新 AI 进展:这条内容属于AI 技能与工作流,核心焦点是解读最新 AI 进展,适合继续追踪它对内容生产、业务执行和工具工作流的直接影响。
使用 GitHub Security Lab Taskflow Agent 进行 AI 驱动的模糊测试
GitHub 博客发布文章,介绍如何使用基于 GitHub Security Lab Taskflow Agent AI 框架的新模糊测试任务流。该内容面向希望把 AI 代理用于安全测试的开发者与安全团队,属于工具方法类信号。
AIHOT 日报参考 2026-09-24:语音、Agent 与企业市场密集更新
本期日报涵盖 Google Gemini 3.8 Flash TTS、Qwen-Audio-3.1、GPT Voice 升级、Antigravity SDK 本地模型、Claude Marketplace、Claude 发现新酶系统、MentalHealthBench 及 Agent 成本优化等信号。
团队分享提升 Agent Harness Token 效率的提示词
公开提示词用于优化 LLM Agent Harness,目标是在不降低任务质量的前提下降低每任务的价格加权 token 成本。某团队一轮改动将整体 token 成本降低约 7%,且质量无损,并建议先映射 harness、测量基线,再按优先级实施改动。
OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用
OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning:30B 总参数、约 3B 激活的混合专家开源权重模型,主攻工具调用、编码等高频且边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成分工。
阿里云 AI Agent 技术论坛报名
阿里云为 2026 云栖大会国际 AI Agent 技术论坛开放报名,主题围绕 AI 原生企业的创新,覆盖云、数据、智能工作、编程与内容创作,并提供注册和直播两种参与入口。
Agentic CLI 自定义项现已纳入 Copilot 用量指标 API
GitHub Copilot 在既有 CLI 报告上新增 agentic 活动指标,覆盖 skills、custom agents、MCP servers、slash commands 和 plugins 五类对象,字段出现在企业级与组织级的每用户报告、聚合 1 天报告、每用户 28 天报告及聚合 28 天报告的 day_totals 中。每类对象提供两组数据:最多五项使用排行的 totals_by_* 数组(含 interaction_count)与衡量使用广度的 distinct_*_use_count。企业和组织管理员据此可以判断哪些 CLI 自定义项正在获得采用、发现启用缺口,并把投入压到开发者真正觉得有价值的自动化上。
DeepSeek-V4.1-Flash(Max)进入 Agent Arena 开源模型第 3 名
DeepSeek-V4.1-Flash(Max)进入 Agent Arena 开源模型第 3,净提升 +4.87%,每任务中位成本 $0.07,以比第 2 名低 68% 的成本重塑 Pareto 前沿。
Agent 长任务上下文工程解析:用预算控制、压缩、todo-state 和记忆对抗上下文溢出与目标丢失
文章拆解 Agent harness 层应对长任务的四类上下文工程机制:预算与卸载、压缩、todo-state 复述和跨会话记忆,分别对抗上下文溢出与目标丢失。
将 VS Code Agents 加入 Copilot 使用指标
GitHub Copilot 使用指标报告新增 VS Code Agents 窗口指标,覆盖企业/组织 1 天与 28 天聚合报告和用户级报告,包含日活用户、会话数、消息数及个人是否使用等字段,需启用策略并具备相应权限才能访问。
重新审视你的 skills、AGENTS.md 和任务提示词,从 GPT-6 Astra 中获得更多收益
OpenAI 开发者账号建议:要让 GPT-6 Astra 发挥更大作用,需要回头整理三样东西——技能定义、AGENTS.md 与任务提示词;把技能触发条件写具体,在相关场景加载对应指引,并明确「完成」的标准。
Mistral 复盘用 AI Agent 迁移 40000 行 Fortran 77 到 C++ 的经验
Mistral 帮助一家欧洲能源运营商将 40000 行 Fortran 77 储层模拟器迁移到 C++,并复盘了用 AI Agent 迁移的方法与经验。
BestBlogs 早报 09-05:AI 原生 SDLC、淘宝数据 Agent、π0.7 与 K2 Horizon 等十条汇总
BestBlogs 09-05 早报汇总十条内容,涵盖 AI 原生软件生命周期实践、淘宝百亿补贴数据分析 Agent、Physical Intelligence 联创 Chelsea Finn 访谈及 π0.7 表现;AIHOT 归类为 industry,来源为 AIHOT 全量,分数 62。
ByteDance 发布 HarnessDev 论文:LLM 能自建 Agent harness,但跨模型迁移仍受限
ByteDance 等机构发布论文 HarnessDev,追问 LLM 能否创建并演化自己的 Agent harness。给出的信号是双向的:自建 harness 这条路被认真研究,但跨模型迁移仍然受限,说明 harness 与具体模型之间存在强耦合。
AgentHands:在XR中为空间锚定的智能体对话生成交互式手势
Google Research推出AgentHands,一个由LLM驱动的XR原型,通过同步、富有表现力的手势增强对话智能体,在物理任务中提供空间锚定的指导,以弥合心理映射差距,增强用户参与度。该研究发表在CHI 2026上。
清华康奈尔研究:ACID-Agent 防记忆污染
清华与康奈尔大学提出ACID-Agent框架,借鉴数据库事务思想,防止智能体记忆将可恢复错误固化为持续错误,提升长期运行可靠性。
AI ANSWERS
这个主题先回答两件事
Agent工作流的核心是什么?
核心是把目标、上下文、工具调用、验收标准和迭代反馈组织成稳定流程。
个人用户怎么开始用Agent?
从低风险重复任务开始,例如资料整理、代码辅助、报告初稿和自动化检查。
NEXT HUBS