Skip to content
Open
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
75 changes: 75 additions & 0 deletions README.es-ES.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,75 @@


# AI Engineering 101
Todo lo que necesitas saber para comenzar con la Ingeniería de IA. En este repositorio, estoy documentando mis notas de aprendizaje sobre Ingeniería de IA.

## Tabla de Contenidos
- [AI Engineering 101](#ai-engineering-101)
- [Tabla de Contenidos](#table-of-contents)
- [Vibe Coding](#vibe-coding)
- [Investigación](#research)
- [Infraestructura de Agentes](#agent-infra)
- [Infraestructura Multimodal](#multimodal-infra)
- [Entrenamiento](#training)
- [Servicio](#serving)
- [Núcleos GPU](#gpu-kernels)
- [Ingeniería](#engineering)
- [Mejores Prácticas para Núcleos](#kernel-best-practices)
- [Mejores Prácticas para PyTorch](#pytorch-best-practices)
- [Mejores Prácticas Multimodales](#multimodal-best-practices)
- [Mejores Prácticas para Ray](#ray-best-practices)

## Vibe Coding
- [Una guía breve (Claude Code)](./Vibe/readme.md) para introducir el vibe coding a personas no técnicas.
- [Una guía breve (OpenCode)](./Vibe/opencode.md) para introducir el vibe coding a ingenieros.



## Investigación
_Avances en investigación sobre infraestructura de agentes e infraestructura multimodal_

### Agent Infra
> La infraestructura de agentes se centra en optimizar el rendimiento en tiempo de ejecución de los agentes en lugar de crearlos. Para más información, consulta [Why agent infrastructure matters](https://blog.langchain.com/why-agent-infrastructure/) y [Agent Engineering: A New Discipline](https://blog.langchain.com/agent-engineering-a-new-discipline/).

1. [Identifying the Risks of LM Agents with an LM-Emulated Sandbox](https://arxiv.org/abs/2309.15817). ICLR 2024.
2. [Autellix: An Efficient Serving Engine for LLM Agents as General Programs](https://arxiv.org/abs/2502.13965). arXiv 2025.

### Multimodal Infra
> Si deseas aprender más sobre modelos multimodales, consulta [Understanding Multimodal LLMs](https://magazine.sebastianraschka.com/p/understanding-multimodal-llms?utm_source=publication-search).

#### Entrenamiento
1. [DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models](https://arxiv.org/abs/2408.04275). arXiv 2024.
2. [DISTMM: Accelerating Distributed Multimodal Model Training](https://www.usenix.org/system/files/nsdi24-huang.pdf). NSDI 2024.
3. [PipeWeaver: Addressing Data Dynamicity in Large Multimodal Model Training with Dynamic Interleaved Pipeline](https://arxiv.org/abs/2504.14145). arXiv 2025.
#### Servicio
1. [Approximate Caching for Efficiently Serving Text-to-Image Diffusion Models](https://www.usenix.org/conference/nsdi24/presentation/agarwal-shubham). NSDI 2024.
2. [Katz: Efficient Workflow Serving for Diffusion Models with Many Adapters](https://www.usenix.org/system/files/atc25-li-suyi-katz.pdf). ATC 2025.
3. [Understanding Diffusion Model Serving in Production: A Top-Down Analysis of Workload, Scheduling, and Resource Efficiency](https://dl.acm.org/doi/10.1145/3772052.3772206). SoCC 2025.
#### Núcleos GPU
1. [Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency](https://arxiv.org/abs/2510.08431). arXiv 2025.
- Núcleo JVP de FlashAttention-2 para entrenamiento
2. [SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration](https://arxiv.org/abs/2410.02367). ICLR 2025.
- Núcleo de atención de 8 bits para inferencia
3. [SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention](https://arxiv.org/abs/2509.24006). arXiv 2025.
- Núcleo de atención dispersa para inferencia

## Ingeniería
_Mejores prácticas de ingeniería para construir sistemas de IA_

### Mejores Prácticas para Núcleos
1. [OpenAI Triton Best Practices](./Engineering/Kernel/triton_tutorial.md)
- Un tutorial práctico sobre las mejores prácticas para escribir núcleos GPU eficientes utilizando Triton.

### Mejores Prácticas para PyTorch
1. [Optimize Training Performance in PyTorch](./Engineering/PyTorch/training_optim.md)
- Utilización de FLOPs del modelo (MFU), PyTorch Profiler y Nsight Systems para monitoreo de rendimiento, Triton y Nsight Compute para optimización de núcleos.


### Mejores Prácticas Multimodales

1. [Disaggregated Hybrid Parallelism with Ray](https://github.com/ray-project/multimodal-training)
- Un marco de trabajo para entrenar modelos de visión y lenguaje utilizando paralelismo híbrido desagregado, donde cada componente del modelo adopta su estrategia de paralelización óptima de forma independiente.

### Mejores Prácticas para Ray
1. [Use Ray for Distributed Machine Learning Apps](./Engineering/Ray/ray_ml_apps.md)
- Escalado de aplicaciones de aprendizaje automático utilizando Ray.