LyShark®

信息安全电子刊物出版品牌

本文讲解基于 LangGraph Server 服务搭建本地离线 AI Agent 的完整部署流程,适配 Windows 开发环境,全程无需调用公有大模型接口,实现纯本地化 AI 推理与工作流编排,帮助开发者快速搭建可调试、可复用的本地私有化 AI Agent 服务,适用于个人开发、本地功能调试、轻量化私有化 AI 场景落地。

阅读全文 »

Advanced‑RAG 是基于 Naive RAG 演化而来的高级检索增强生成方案,针对朴素RAG检索不准、上下文相关性差、召回噪声多等缺陷进行多层优化。该方案完全沿用朴素RAG的基础流水线模式、不改动核心架构,仅在各流程节点嵌入预处理、后处理增强模块,精细化优化检索环节。通过引入查询改写、重排序、上下文压缩、自我校验等多种增强策略,对召回的文档片段过滤去噪、重排优先级,精准筛选高价值上下文送入大模型,以此来提升提升知识库问答的精准度与稳定性,是目前工业级RAG落地的主流优化方案。

阅读全文 »

向量检索增强生成(RAG,Retrieval‑Augmented Generation),是弥补大语言模型固有缺陷的关键技术。它可接入私有文档、内部笔记等外部数据源,有效缓解训练数据滞后、知识固化、回答幻觉等问题,输出更为精准可信的内容。Naive RAG 即朴素 RAG,是 RAG 体系中最基础原始的实现方式,也是各类进阶 RAG 技术的底层基石。该方案架构极简、落地门槛低,舍弃复杂优化手段,只保留检索加生成的核心能力。很适合新手学习实践,同时该方式也多用于搭建轻量化知识库问答服务,适配各类简单问答场景。

阅读全文 »

本文基于LangGraph会话记忆管理相关内容,聚焦对话持久化存储方案,以LangChain官方推荐的PostgreSQL数据库为载体,拆解Checkpointer检查点存储与Store通用长期存储两大核心体系。通过对比两套存储机制的底层逻辑、差异特点与适用场景,结合可运行实战代码,实现会话重启续聊、跨线程记忆共享、语义检索、用户档案管理等核心能力,为LangGraph生产级智能体项目提供标准化持久化实现思路。

阅读全文 »

为解决大模型外部工具调用、上下文传递标准不统一、适配混乱的痛点,本文基于 MCP 模型上下文协议,使用轻量化 FastMCP 构建 MCP 服务端,借助 langchain‑mcp‑adapters 完成与 LangChain 生态集成。文章介绍 Streamable HTTP 传输模式的适配场景,以天气查询及日期时间读取作为实战案例,完成自定义工具、资源接口、提示词模板开发,并演示 LangChain 客户端加载工具、读取资源、解析提示词、多服务协同调用完整流程,附带可运行代码与依赖配置,提供一套轻量化标准化的大模型工具调用实践方案。

阅读全文 »

在 LangGraph 构建 Agent 应用时,会话记忆是核心能力,借助 Checkpointer 搭配 thread_id,可以自动保存每一轮对话轨迹与消息历史,实现多会话隔离。本文基于 InMemorySaver 内存存储,演示交互式会话切换、查看、清空等基础操作。讲解消息条数修剪、Token 阈值修剪、消息删除等处理方案;同时为避免直接丢弃历史造成信息丢失,实现对话历史摘要压缩方案,在控制上下文长度的同时保留关键对话信息,适合本地 GGUF 类大模型 Agent 开发学习参考。

阅读全文 »

本地大模型开发已经变得十分便捷,llama.cpp 作为轻量高效的 GGUF 模型推理引擎,可以在普通 PC 上运行 Qwen、Llama 系列量化模型。LangChain 作为大模型应用编排框架,除了对接云端 OpenAI,还能对接 llama‑server 的 OpenAI 兼容接口,不仅可以实现基础对话,还能开发具备工具调用能力的 Agent 智能代理。本文将依次演示LangChain框架的安装、基础对话调用、自定义工具 Agent 开发等功能实现。

阅读全文 »

LangChain 是目前大模型应用开发领域最主流、最成熟的开源框架之一,广泛应用于私有化部署、智能体开发、工具调用、流式交互等各类场景。本文基于 LangChain 最新稳定版接口,适配本地私有化 GGUF 模型部署环境,拆解框架四大核心基础能力,标准化消息机制、闭环工具调用链路、多场景流式传输、规范化结构化输出功能,这四个功能是学习后续框架的基础部分,也是必须要熟练掌握的重点。

阅读全文 »

本文以通义千问Qwen量化GGUF模型为案例,基于Llama.cpp框架展示本地大模型调用与功能开发的完整实现原理及流程。全文采用原生Python编写代码案例,无需依赖重型AI框架,依次实现模型元数据解析、本地接口单次对话调用、多轮对话持久化记忆、自定义工具调用拓展等功能实现逻辑,针对直接调用大模型上下文断裂、功能单一、拓展性不足等问题,通过轻量化对话记忆与工具解析执行框架完成优化实现,拆解本地对话交互运行原理,帮助开发者掌握大模型的基础调用原理。

阅读全文 »

llama.cpp 是一套轻量级开源大模型推理引擎,支持在普通消费级硬件完成大模型本地推理,无需高性能显卡即可运行 GGUF 量化模型。本文面向 Windows 平台开发者,完整介绍环境准备、源码编译、魔搭社区下载 GGUF 量化模型、命令行交互、llama‑server API 服务部署全过程,并提供原生 Python 接口调用示例,帮助读者快速搭建属于自己的本地大模型推理服务。

阅读全文 »