文章总结: 本文介绍火山引擎StorageAgentFamily,通过TOSAgent和TLSAgent实现存储管理的对话式工作台,支持自然语言完成建桶、异常排查、数据洞察等任务,降低使用门槛,提升运维效率。核心机制包括无上限会话、长期记忆、用户凭证贯穿动作及安全护栏,确保操作安全可控。 综合评分: 81 文章分类: 产品介绍,安全建设,云安全,安全运营,解决方案
Storage Agent Family: Agent 时代,重构云存储的“人机交互”
原创
火山引擎存储 火山引擎存储
字节跳动技术团队
2026年7月20日 18:00 北京
在小说阅读器读本章
去阅读
系列定位:本文是《从 Data Lake 到 State Lake:面向 Agent 时代的存储基础设施重构》的续篇。上一篇讲了 Agent 时代重新组织的三条存储主线:Sandbox Store、Artifact Store、Agent 观测 & 评测。这一篇聚焦最“面向用户”的一条支线——存储产品自身的 Agent 化,我们称之为 Storage Agent Family。
从一个真实场景开始
一位做 AI 数据运维的同学,一天要打开火山引擎控制台好几次。
建个训练数据桶要跳几个页面:建桶、配 KMS 加密、开版本控制、改 ACL、配访问日志,一步漏了,审计就找上门。
下午图片打不开,他打开对象存储控制台,权限、限流、CORS 配置挨个查,页面来回切。晚上老板追问上月账单涨 30% 的原因,他又得跑费用中心拉数据、自己算,再琢磨要不要把冷数据转归档。
功能都有,每一项能力在控制台里也都找得到,但“明明会用,就是费劲”的感觉始终挥之不去。
往大了说,今天用 TOS,明天查 TLS 的日志,后天团队上 vePFS 或 EFS。每款存储都得重新学一遍怎么用:菜单不同、概念不同,连“哪个操作要二次确认”的规则都不一样。
存储能力从来不是问题,真正的痛点是:用好存储,始终缺一个统一、懂人话的入口。
Storage Agent Family 是什么
Storage Agent Family 不是一个新产品,也不是一个“统一大 Agent ”,而是火山引擎存储线上 N 款存储产品各自的 Agent,共同遵守的一份约定——TOS 有 TOS Agent,TLS 有 TLS Agent,后面还会有 vePFS、EFS、EBS、MQ 的 Agent。每款 Agent 都由对应的产品团队独立打造,但它们对外呈现的样子是“一家人”。
它想给客户解决的问题很简单:
引入一个存储管理的专家伙伴,协助客户更高效地管理和使用存储产品。建生产桶、批量改配置、排查访问异常、算账单、找素材、做创作、查日志、追延迟,过去要跨十几个页面,甚至写脚本才能完成的活儿,现在一句话说清楚意图,Agent 自主规划,逐步执行,每一步都可看、可停、可纠偏。
接下来,先看家族里已经上线的两位成员——TOS Agent 和 TLS Agent,分别代表家族里最典型的两种形态:一个偏运维向,一个偏分析向。
TOS Agent:让日常运维“说人话”
TOS Agent 是家族的第一个成员,不是控制台边上的一个问答框,而是客户在 TOS 上的主工作入口,把日常存储工作中的高频、繁琐、吃专业经验的活儿,交给一个能听懂意图、自主规划、随时可纠偏的工作台来做。
四类场景:工作台在真实业务里做什么
日常运维:一句话,编排一整套操作
过去建一个生产级桶要在多个 Tab 之间反复跳,批量改一批桶的配置只能逐个点或自己写脚本,现在把意图说清楚就行:
“帮我建一个用于 AI 训练数据的桶,开 KMS 加密、开版本控制、关闭 ACL 公共访问、接入访问日志。”
“给我账号下所有华东 1 区域、对象数大于 1000 的桶,统一开启访问日志。”
TOS Agent 把这类指令拆成一条有序执行链,逐步落地,过程透明。遇到批量变更或不可逆动作,它会先做一次影响预演(Dry-Run),清晰呈现波及范围,再等你确认——把“多步操作编排”从体力活变成一句话。
异常排查:从一条报错,追到根因和修复
线上访问出问题,问题根因,可能是权限、签名、CORS、限流、慢请求等,排查过程需要很多专业经验。TOS Agent 会把这些细活接过来,如把一个打不开的图片链接甩给它,它自己解析 URL 和报错、拉访问日志和监控指标做聚合分析、对照错误码释义找根因,最后给一份“现象 → 根因 → 修复建议”的结论——从“告诉你为什么不行”,到“帮你把问题解决”。
数据洞察:把账单、热点、冷热分层,一次问清
TOS 计费项多,每个桶的费用和访问结构都不一样,“上个月账单为什么突然涨了 30%?” “哪些对象近 90 天没被访问,转归档能省多少?”这类问题以前要跨几个系统才能算清。
现在,TOS Agent 会自动拉账单和计量数据、识别异常波动并归因、分析访问热点和冷热分布,最后给你一份结构化的洞察报告和能落地的优化建议。生命周期策略、归档、加速器、QoS 都在里面—— “数据”从一个单纯被查询的对象,变成了一个能解释与建议的洞察对象。
多媒体创作:找素材、做创作、回存,一气呵成
这是 TOS Agent 最具想象力的场景,它联动内容感知和处理能力,让你在一个对话里跑完“找素材 → 做创作 → 存产物”的完整闭环。基于多模态语义,从海量素材中直接召回符合描述的图片或视频片段;调用生成能力,完成改图、加水印;产物再自动回存到指定桶,天然沿用你的权限和治理策略,后续业务流转也直接用——对媒资、电商、营销团队来说,素材生产链路从“多个工具来回倒腾文件”,简化成“在一个对话中说清楚需求”。
四项关键机制:让“对话式工作台”真正可用
能编排的 Agent 有很多,但让客户敢把线上生产活儿交出去,靠的不是“模型有多聪明”,而是长时协作、记忆连续、权限边界、动作安全这四项能力全部可靠。TOS Agent 在这四项能力上均做了针对性设计,这也是 Storage Agent Family 中所有成员必须恪守的底线。
活跃会话数量无上限
传统智能助手常受限于固定的会话资源,开多了就排队,被回收。TOS Agent 依托 TOS 原生分布式架构承载会话,不对活跃会话数量设上限,你可以为“排查异常”“月度成本盘点”“整理素材”分别开一条独立会话,并行跑互不干扰,跑到一半关掉,下次打开还能继续。
这一点对大规模创作团队尤其关键,成百上千名创作者同一时刻打开工作台,每个人都有一条独立、不掉线的会话,不会因为“别人在用”而被降级或被踢下线。
User 级长期记忆
工作台会为每一个 User 维护独立的长期记忆空间,把跨会话的偏好和上下文沉淀下来:常用地域、命名规范、加密和权限基线、关注的成本口径……这些都会被记住,并在后续任务里自动复用。记忆的写入、召回、归档由服务端统一治理,用自然语言就能管理,你不用关心底层实现。
你不用每次从头交代背景,它越用越懂你。
User 凭证贯穿全部动作执行
这是工作台安全模型的核心,发起任务的 User 凭证,会贯穿此次任务里 Agent 触发的每一个动作。不管是查询、配置变更,还是数据读写,Agent 调用的每一个工具都携带你的凭证,在你的权限边界内执行。它能做的,永远是“你本来就能做的事”的子集,不会因为“交给了 Agent ”就越权碰到你无权访问的资源。
能力被放大,权限边界却分毫不变。
动作安全护栏:Commit + Dry-Run + 分级管控
写操作,先 Commit,再执行。当模型识别到此次发起的是一个写请求(创建、变更、删除、覆盖、批量),它不会“想到就做”,而是主动把动作弹到前台,清楚地告诉你“我准备做什么、影响哪些资源、可能产生什么后果”,等你确认之后才真正落地。
Commit 之上,工作台还叠加几层护栏:删除这类不可逆动作触发前,主动提示影响范围并进行二次确认;写入优先用“不存在才写”语义避免误覆盖;配置变更、存储类型转换等动作先做预演(Dry-Run);不同 API 动作按读、写、删除分级管控,高危动作要更强的确认。
工作台拥有自动执行的能力,但把“按下确认键”的权力始终交还给你。
再往上一层,当你要把这套工作台打包转售给自己的众多终端客户时,TOS Agent 借助 TOS 原生的让多租户隔离开箱即用,每个客户一个专属空间,工作空间、会话、记忆、配额彼此隔离,一套工作台就能服务成百上千家客户。
TLS Agent:可观测分析专家
TLS Agent 是家族的第二个成员,由日志服务团队独立研发,与 TOS Agent 为两条平行的研发线,但体验一致,是出自同一家族的产品。
日志服务是云上承接日志、Trace、指标和各类机器数据的接入入口和存储分析底座,能力完整。但业务问题的观测诊断分析,也还需专家经验的积累。新用户要先弄明白每类功能解决什么问题,从哪儿开始;老用户在复杂场景下,需编写好检索分析语句,查询经验文档,拆解问题分析的步骤。
TLS Agent 旨在降低使用门槛,并进一步把可观测信息转成可行动的洞察,让用户从“找到一条日志”,走向“理解一个系统现象”。
当然仅靠 Text2SQL 是无法实现的,日志服务团队做的是让 Agent进入日志服务的工作流。
整体拆为三层能力:一个可探索的知识底座、一个可执行的工作环境、一套能把注意力拉回来的分析引导机制。
可探索的知识底座:LLMWiki
日志分析既要懂产品知识,也要懂用户业务知识:服务拓扑、接口含义、错误码、告警规则、历史故障、团队 SOP,这些往往只存在于用户自有文档和经验中。
如果只是把所有文档切片做向量检索,召回容易变得不稳定:多了变噪声,少了漏关键。TLS Agent 用 LLMWiki 把知识库做成一个可探索的空间,不是一次性把片段塞进上下文,而是按任务阶段逐步探索,先限定知识空间和目录,再看文件名、标题和片段命中,最后只在确认有价值时才扩读原文。
图谱结构补充“相似搜索不一定命中”的部分,它告诉模型“这篇文档为什么可能相关,什么时候值得继续读”。RAG 从“搜到一段相似文本”,升级为“找到一组更小、更准、可解释的分析上下文”。
长期记忆是闭环的一部分,单次分析完成后,经确认的业务背景、常见问题、资源偏好和排障路径会自动沉淀,下次遇到同类问题,Agent 可准确分析,无需从零理解。
可执行的工作环境:Sandbox
可观测分析中,很多任务无法仅在模型上下文内完成,Agent 需要真实、稳定、可控的执行环境,支撑 Agent 运行查询、执行验证脚本、对结果程序化处理。
TLS Agent 以 TLS CLI 作为统一的能力入口:TLS API 覆盖的资源和动作多,若每个 API 都包装为模型可见的工具,会导致工具列表迅速膨胀;CLI 让 Agent 可像工程师一样,通过命令分组、子命令和 help 渐进式了解产品能力。
选了 CLI,就要有终端。Sandbox为 Agent 提供稳定的工作台:
沙箱支持运行命令、保存中间文件、读取输出,失败继续调整重试;每个 Skill 除提示词和工具调用外,自带验证脚本,可检查返回字段是否完整、时间范围是否正确、统计口径是否符合预期、查询结果是否足以支撑当前结论。Agent 不会生成“看似合理的答案”,而是能在沙箱里做检查、发现问题、重试。
海量日志检索的过滤、聚合、TopN、趋势等重计算,优先下推至 TLS 检索分析引擎,Agent 不用拿模型去替代检索系统做大规模计算。若结果体量依然过大塞不进上下文,Agent 会在 Sandbox 内通过 rg、Python 完成筛选、统计、抽样、校验,再把更小、更关键的事实交给模型组织表达,不把“样例观察”当成“总体结论”。
上下文引导:让注意力回到关键约束
完整的日志分析需经历多轮交互:确认问题、理解资源、读取知识、生成查询、执行工具、修正路径。上下文越长,模型越容易被中间信息带偏,忘掉最初的分析目标、时间范围、过滤条件。
TLS Agent 设计了注意力引导模块,可以根据规则注入重要提示信息,不替代 Agent 做决策,只在关键节点把容易丢失的约束重新放回模型视野:
- 从“收集信息”进入“生成查询”时,把原始用户需求带回来,提醒 Agent 核对目标、时间范围和过滤条件;
- 执行较重的查询前,引导 Agent 先收敛范围,关注时间窗口、索引命中、返回行数和查询效率;
- 涉及趋势、聚合、异常判断时,提醒 Agent 把结论建立在检索分析能力之上,而不是几条样本上。
这类引导看起来很轻,但对长任务的稳定性很重要。
内部实践:真实排障案例
说了这么多机制,不如看两个例子。
“这个采集规则凌晨被改过,日志消失了,帮我确认是不是人为操作,具体原因是什么?”
“近 12 小时数据加工任务有入库延迟,帮我分析下延迟发生在哪个阶段。”
案例一 | 操作溯源:用户反馈某个采集规则在凌晨被改后日志消失,想确认是否人为操作及具体原因。
TLS Agent 结合用户提供的项目、Topic 和采集配置上下文,定位到对应的操作记录,输出修改时间、接口、操作者、来源和命中资源,排障过程从“猜是谁改了配置”,转为“基于操作证据分析影响和解决方案”。
案例二 | 延迟归因:用户反馈近 12 小时有入库延迟。
Agent 结合任务 ID、源 Topic 和时间范围检索内部日志,定位到延迟集中发生在源端消费恢复阶段:消费者心跳过期后触发 worker 批量重建,任务恢复后继续处理,未发现持续写入阻塞或执行错误。分析把“入库慢”拆解为可验证的阶段和证据,便于判断是短时抖动,还是要继续追链路瓶颈。
每一次这样的分析,经确认的业务背景、常见问题、资源偏好和排障路径都会沉淀进长期记忆,下次遇到相似问题不必从零讲起,Agent 对同一团队、同一系统的理解会越来越稳定。
Storage Agent Family 一致性
看完两个成员,我们把 Storage Agent Family 对客户的价值收拢成三条,每一个加入家族的存储 Agent 都会遵守。
一致的操作节奏,不用重新学。不论是 TOS Agent 还是 TLS Agent,对话入口、数据范围选择、结果呈现、“先选范围、再对话、危险动作先确认”的节奏都完全一样。不用换一款产品重学一遍,这是“学会一个,用好每一款”最直接的兑现。
一致的安全底线,可放心交付任务。三级风险分级(只读直接执行 / 写入二次确认 / 破坏性拒绝自动执行)、User 凭证贯穿全部动作、写操作先 Commit 再执行、数据范围围栏、执行前权限校验——这些不是可选项,而是家族的常开底线。TOS Agent 有,TLS Agent 有,后面每一个成员也必须有。
越用越懂你的系统。每次任务中经用户确认的业务背景、排障路径、资源偏好,都会沉淀到该 User 的长期记忆中,下次任务自动召回。这对每款存储 Agent 都成立——用得越久,Agent 对你团队和系统的理解越准。
另外,家族对外统一接口,支持像装插件一样接入更多的存储 Agent;你在一个产品里问到另一个产品的问题,会主动引导你跳转,不断档。
写在最后
“用好存储”这件事,过去需要摸透控制台、用溜 SDK、背全最佳实践。
现在有一个听懂话的伙伴,能把多步操作自动编排、异常根因定位、成本与洞察一次问清、长任务与长记忆稳定运行,而且这套体验在每一款存储产品中都一致。
Storage Agent Family 已经上线 TOS Agent 和 TLS Agent,vePFS、EFS、EBS、MQ 的 Agent 已经在路上。它们从第一天就遵循同一份家族约定,未来会沿着两个方向走下去:一是让家族成员更多,覆盖场景更广;二是把 Agent 和工作区更深地打通,让人和 Agent 在同一个工作区里并肩工作,不必再在文档、控制台和聊天窗口之间来回切换。
火山引擎 Storage Agent Family: 让每一款存储产品,都长出一个懂它、也懂你的专家。学会一个,用好每一款。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:字节跳动技术团队 火山引擎存储 火山引擎存储《Storage Agent Family: Agent 时代,重构云存储的“人机交互”》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论