代码与生活

Ek Jindri Meri

Home Archives
2026
5月 30

从零造一个 GPU 编译器:T0-GPU 作为课程项目的设计与实践

5月 30

macOS NT QQ 聊天记录解密

5月 29

当 AI Agent 碰上 LLVM 后端:一场关于 GPU 指令调度的诚实实验

5月 28

cuasmrl 部署实录:用 RL 优化 CUDA Kernel 指令调度

5月 19

实验室单卡GPU虚拟化:K3s + Z2JH + HAMi 实现多用户GPU共享

5月 15

AMD uProf 性能分析:矩阵乘法优化之旅

5月 8

上海科技大学校园网 OpenWrt 配置指南

5月 6

DeepEP H20 GPU Replay Benchmark 教程

分类

  • AI 开发
    • 开源项目
  • AMD
  • Deep Learning
    • System
  • GPU Programming
    • Compiler Optimization
  • GPU计算
    • ROCm
  • Infrastructure
  • 嵌入式
  • 技术分享
  • 技术实践
  • 系统优化
  • 系统研究
  • 系统编程
    • GPU 编译器
  • 编译器
    • HPC
  • 网络
  • 运维

标签

  • ACR
  • AI Agent
  • AI for Code
  • AMD
  • AMD RDNA3
  • AWS
  • Aliyun
  • Benchmark
  • CPU
  • CUDA
  • Claude Code
  • Codex
  • Compiler
  • DeepEP
  • DeepSeek
  • DeepSeek V4 Flash
  • Docker
  • ECR
  • ESXi
  • Embedded
  • Flash-Attention
  • FlashAttention
  • GPU
  • H20
  • HAMi
  • HomeLab
  • IPv6
  • JupyterHub
  • K3s
  • KV-Cache
  • Kubernetes
  • LLM
  • LLVM
  • LuckFox
  • MI50
  • NCCL
  • OpenClash
  • OpenCode Go
  • OpenWrt
  • Profiling
  • PyTorch
  • ROCm
  • RV1103
  • RX580
  • Register Pressure
  • Rust
  • Ryzen AI
  • SQLCipher
  • SQLite
  • Security
  • Triton
  • compiler
  • inference
  • llama.cpp
  • ucode
  • vLLM
  • 上海科技大学
  • 协议转换
  • 开源项目
  • 强化学习
  • 性能分析
  • 指令调度
  • 校园网
  • 测试报告
  • 缓存优化
  • 编译器
  • 编译器优化
  • 虚拟化
  • 调优
  • 逆向工程
  • 部署

标签云

ACR AI Agent AI for Code AMD AMD RDNA3 AWS Aliyun Benchmark CPU CUDA Claude Code Codex Compiler DeepEP DeepSeek DeepSeek V4 Flash Docker ECR ESXi Embedded Flash-Attention FlashAttention GPU H20 HAMi HomeLab IPv6 JupyterHub K3s KV-Cache Kubernetes LLM LLVM LuckFox MI50 NCCL OpenClash OpenCode Go OpenWrt Profiling PyTorch ROCm RV1103 RX580 Register Pressure Rust Ryzen AI SQLCipher SQLite Security Triton compiler inference llama.cpp ucode vLLM 上海科技大学 协议转换 开源项目 强化学习 性能分析 指令调度 校园网 测试报告 缓存优化 编译器 编译器优化 虚拟化 调优 逆向工程 部署

归档

  • 八月 2026
  • 六月 2026
  • 五月 2026
  • 三月 2026
  • 十二月 2025
  • 十一月 2025
  • 十月 2025
  • 二月 2025

最新文章

  • 本地 27B Q4 + opencode 全程驱动:hami-learning-cloud 教学云更新实录(附模型自评)
  • 纸上得来终觉浅,绝知此事要躬行——llama.cpp 部署调优实录
  • OpenCode Go Relay:让 Claude Code 和 Codex 共用 DeepSeek V4 Flash 的超低价模型
  • What Happens When You Increase num_warps in Triton — 寄存器压力的实证调查
  • 从零造一个 GPU 编译器:T0-GPU 作为课程项目的设计与实践
© 2026 youyoulyz
Powered by Hexo

沪ICP备2026020990号-1 | 沪公网安备沪公网安备31011502406269号

Home Archives