Zhanbo's Blog
Back to home

All Blog Posts

Documenting technical insights from my learning journey, sharing practical experience in Java backend, Spring ecosystem, AI Agent, and more.

AI AgentLearning Notes
2026-08-26
15 min read

从 Benchmark 到企业实践:系统理解 LLM Agent Evaluation

本文以 ACL 2026 Findings 的综述论文 A Survey on Evaluation of LLM-based Agents 为主线,系统梳理 Agent Evaluation 的能力评测、应用型 Benchmark、通用 Agent、评测框架与 Gym-like Environment,并重点解释 Conversational Agent 的测试机制、Reference-based 与 Reference-free Trajectory Assessment、Human-in-the-loop,以及 backbone LLM 与 Agent Harness 的解耦评测。文章进一步从工程实践出发,讨论垂类 Research Agent 应如何组合确定性检查、LLM Judge、专家标注与现有 Eval 平台,以及企业如何通过 Golden Set、Regression Set、CI Gate 和线上监控建立持续评测闭环。

LLMAgentAgent EvaluationAgent HarnessBenchmarkTrajectory EvaluationLangfuseLangSmithResearch AgentLLM-as-a-JudgeAI Engineering
RAGLearning NotesAI Agent
2026-08-03
11 min read

读懂 LlamaIndex:从 RAG 数据流到 Tool、Agent 与 Workflow

LlamaIndex 经常和 LangChain、LangGraph、smolagents 一起出现在 Agent 教程中,但它真正有辨识度的部分并不是 Agent 或 Multi-Agent,而是围绕私有数据建立的一整套 RAG 抽象:DocumentNodeIngestionPipelineVectorStoreIndexRetrieverQueryEngineResponseSynthesizer。本文从一份 persona 数据集出发,完整拆解数据加载、分块、Embedding、向量存储、检索、回答合成与评估的链路,并进一步解释为什么 QueryEngine 还要包装成 Tool、什么时候 Agent 层属于过度设计、Workflow 又如何通过 Event 类型连接多个 Step。最后给出 LlamaIndex、LangGraph 与 smolagents 的定位对比,以及本地运行 Notebook 时遇到的典型问题。

LlamaIndexRAGEmbeddingVectorStoreChromaDBRetrieverQueryEngineAgentWorkflow
AI AgentLearning Notes
2026-08-02
15 min read

读完 Pi Coding Agent:一个 Agent Harness 应该拥有多少状态?

继续阅读 Pi Coding Agent 的设计文章后,我发现作者反复强调的并不只是“功能少”,而是尽量不让 harness 拥有隐藏状态。Pi 保留最小 agent loop、事件流和工具协议,却把 todo、plan、MCP、后台进程与 sub-agent 等能力交给普通文件、CLI、tmux 和独立 session。本文沿着我阅读时提出的问题,梳理这种设计的收益、代价,以及它对自建 Agent 和 eval 的启发。

PiCoding AgentAgent HarnessTool CallingTUIMCPMulti-AgentContext EngineeringAgent Eval
AI AgentLearning Notes
2026-08-01
7 min read

阅读 Pi Coding Agent:从多 Provider 兼容到结构化工具结果

Pi 通过 pi-ai、pi-agent-core、pi-tui 和 pi-coding-agent 实现模型协议、Agent 编排、终端界面与 CLI 应用的分层。在多 Provider 支持上,Pi 使用兼容配置统一 OpenAI-compatible API 的字段、reasoning 和 usage 差异;Token 统计则以 Provider 实际返回的数据为准,因此只能做到 best effort。跨 Provider 切换时,Pi 会保留或降级转换 reasoning 等上下文,但无法保证私有签名和超长上下文无损迁移。此外,Pi 支持端到端中止流式请求,并通过结构化工具结果区分模型可见内容与 UI 专用数据,从而保持 Agent 核心的透明、精简与可扩展。

PiCoding AgentAgent HarnessLLMSSETool CallingContext EngineeringTypeScript
Learning NotesRAGAI Agent
2026-07-28
5 min read

从 @tool 到 BM25:smolagents 中 Tool 与 RAG 的四种认知纠偏

在学习 Hugging Face Agents Course Unit 2.1 时,我以为自己懂了 Tool 和 RAG,直到看到源码和 notebook 才发现好几处理解偏差。这篇笔记记录了从 @tool 装饰器到 BM25 稀疏检索的四个关键问题。

smolagentsRAGBM25Agentic-RAGHuggingFace学习笔记稀疏检索
Pitfall Notes
2026-07-19
3 min read

Typora + PicGo + Cloudflare R2 图床上传成功却裂图:一场 URL 拼接的踩坑实录

Typora中借助PicGo上传图片至Cloudflare受阻,本文通过正确拼接URL,上传图片并在本地正确输出。

TyporaPicGoCloudflare R2图床Markdown踩坑记录
Learning Notes
2026-07-11
3 min read

Claude Code 使用技巧:PowerShell Alias 与权限 Bypass

在 Windows PowerShell 中为 Claude Code 设置快捷 alias c-d,并默认使用 --dangerously-skip-permissions 启动,减少重复输入与权限确认。

Claude CodePowerShellAliasCLI