Sia's Space

Back

项目

这里放我正在做的项目。记录它想解决什么、怎么做,以及还有哪些地方值得继续试。

访问我的 GitHub

SkillClaw Summarizer GRPO

一次 Agent 任务会留下很多交互记录。这个项目尝试把它们整理成简洁、准确的摘要,保留关键决策和失败尝试,让后续的技能生成有据可循。

Agent Summarizer Training Pipeline
构建摘要训练数据、质量扫描与分层评估流程,支持 SFT 与 GRPO 数据格式。
GRPO Reward & Quality Gate
围绕事实一致性、信息覆盖、简洁性和格式质量设计组合奖励、后处理与回退机制。
Evaluation & Inference Integration
整理离线评测、数据质量报告,并将小模型摘要能力接入技能演化服务。

技术实践

  • Python、Go、FastAPI、FastMCP、Gin、GORM
  • LLM Agent、MCP、SFT、GRPO、OpenAI-compatible API
  • Redis、消息队列、Milvus、Neo4j、MySQL、PostgreSQL
  • Docker、Kubernetes、OpenTelemetry、Prometheus