用两台 DGX Spark(GB10)部署 DeepSeek-V4-Flash(284B/13B-active,官方 FP8):为什么 128GB 单机装不下 149GB 权重、如何为 GB10 的 sm_121 架构选对 vLLM 引擎、源码构建中 torch 被悄悄降级的隐蔽问题,以及 MTP 调优后的实际吞吐。
K8s Service 访问链路:域名如何解析到 ClusterIP,再转发到 Pod
我顺着一个 Pod DNS 排查短视频,把 K8s Service 网络链路重新整理了一遍:DNS 解析、ClusterIP 到 Pod IP 的 DNAT、EndpointSlice、负载均衡,以及 1.36 时代 iptables/IPVS/nftables/eBPF 的取舍。
Spring Boot 3.4+ 的结构化日志:5 行配置启用 ECS,用 Fluent API 写出 OpenSearch 可查的字段
Spring Boot 3.4+ 内建了 ECS 结构化日志支持,5 行配置能替掉大部分手写的 logback-spring.xml,再用 SLF4J Fluent API 把字段写成 OpenSearch 查得到、聚得起来的样子。
feature 加得快,不等于产品更好,AI 时代的一点克制
读 Nick Hodges 的《A new challenge for software product managers》后,我顺手记下几条工程师视角的补充:当 AI 把“工作量”这道闸拆掉后,我会怎么判断一个 feature 值不值得进来。
Spring Boot 3.5 Tracing:接完之后,PII 和采样怎么管
结合一次 Spring Boot 3.5 tracing 接入:自动配置覆盖范围、自定义埋点、Kafka/Redis/DB 组件接入、采样策略、PII 处理,以及用 ArchUnit 约束常见误用。
Java 日志开发约定:记什么、不记什么、message 与结构化字段怎么写
Java 日志里记什么、不记什么、message 怎么写、结构化字段如何设计;也整理我在 Spring Boot 项目里落地这些约定时的一些取舍。
CDN 和 DNS 是怎么配合工作的?网站如何在 DNS 宕机里争取可用性
从递归解析器、权威 DNS、CDN 导流到边缘 PoP 的完整链路出发,整理 CDN 与 DNS 如何协作,以及网站如何在 DNS 宕机、控制面异常和缓存收敛延迟中争取更好的可用性。
Confluent Kafka topic 该分多少分区:按业务规模算,再对成本和连接数
Confluent Kafka 的 topic 分区数按当前业务规模假设算了一轮,起步先按 12 个分区配置。
Homelab 过热?给 Proxmox Debian 宿主机降温的完整实战
Homelab 的 Proxmox 宿主机(AMD Ryzen 5 5600H)CPU 温度长期 72°C,通过诊断发现 VM 内存超售、Turbo Boost 未关、KSM 高频扫描三个热源,用 Ansible 一键优化后降到 62°C。
我怎么理解 AI Agent Skills:规范、实证,以及落地时的取舍
我把 Agent Skills 的开放规范、SWE-Skills-Bench 的实证结果,以及 Daniel Sogl 对 skill eval 的反思放在一起看,试着回答三个问题:skill 适合解决什么问题、什么时候值得投入,以及为什么没有 eval 的 skill 很容易变成一份没人验证的 Markdown。